摘要
本发明公开了一种基于大语言模型的低标注海外多国地址的解析方法,该方法具体包括如下步骤:S1,获取标注数据,从目标国地址数据库中获取地址数据,进行标注获得结构化数据;S2,将S1中获取的结构化数据进行拆分为训练集和测试集,通过训练集数据获取字段质量检测模型,根据获取的F1值筛选出质量差的字段;S3,获取高质量训练测试数据;S4,将S3中的高质量训练测试数据进行拆分,分为训练集和测试集,通过训练集数据并基于大语言模型训练获取打标助手模型;S5,W2NER小模型训练并上线。本发明通过少量的标注数据训练,结合字段质量检测算法和优化后的数据进行二次训练,实现了小型化且高效的海外地址解析模型。