一种集成预训练NLP模型的文本数据自动化标注方法及系统
申请号:CN202510896609
申请日期:2025-07-01
公开号:CN120407775B
公开日期:2025-09-05
类型:发明专利
摘要
本发明提供一种集成预训练NLP模型的文本数据自动化标注方法及系统,涉及人工智能技术领域,所述方法包括:获取待标注的原始文本数据,所述文本数据包括客户咨询、投诉或反馈的对话记录、评价及工单;对原始文本数据进行分词、停用词过滤及词性标注处理,生成结构化文本数据;将结构化文本数据输入预训练NLP模型,通过领域适配层对模型输出的语义特征进行修正,以得到修正后的语义特征;对修正后语义特征进行少样本学习,通过对比学习机制强化对低频文本模式的识别能力,生成抗长尾干扰的增强特征向量。本发明通过自动化处理数据获取与预处理,集成预训练NLP模型实现文本数据自动化标注。
技术关键词
文本
语义特征
标注方法
样本
词语
数据
低频标签
术语
生成标签
关键词
原型
实体
注意力机制
分类器
序列
分词
自然语言
决策