摘要
本申请涉及元数据生成技术领域,其公开了一种基于大模型的数据平台元数据自动生成方法,其首先对原始SQL代码进行统一标准化和初步语法分析,以获取结构化中间表示。在此基础上,进行基于规则的初步血缘分析,快速识别并处理简单列引用。对于那些传统方法难以准确解析的复杂表达式,则将其代码片段及其上下文信息精确提取,并交由大语言模型进行深度语义理解与复杂血缘解析。最终,将大模型解析出的复杂血缘与初步血缘列表进行整合,形成全面且精确的字段级血缘关系,进而生成完整的数据平台元数据。这样,有效地弥补了传统解析工具对复杂语义理解的不足,显著提升了元数据生成的准确性和完整性。