一种基于大模型Word文档段落比较相似度的实现方法及系统
申请号:CN202510992033
申请日期:2025-07-18
公开号:CN120874805A
公开日期:2025-10-31
类型:发明专利
摘要
本发明涉及自然语言处理技术领域,具体为一种基于大模型Word文档段落比较相似度的实现方法及系统,包括以下步骤:数据预处理,文档向量化,相似度计算;有益效果为:通过引入预训练的大模型,该方法能够更深入地理解文本内容,捕捉文本的深层语义信息,从而更准确地衡量段落间的语义相似性。这相较于传统基于关键词匹配或表面特征的方法,在复杂语义环境下的表现更为优越。
技术关键词
度度量方法
中文分词工具
大规模文本数据
自然语言
停用词表
交叉验证方法
度计算方法
字符
编辑
文本段落
中文文本
阶段
浮点数
语义环境
系列
模块