基于多维度奖励函数优化大语言模型回答忠实性的方法及系统
申请号:CN202510992937
申请日期:2025-07-18
公开号:CN121009982A
公开日期:2025-11-25
类型:发明专利
摘要
本发明公开了一种基于多维度奖励函数优化大语言模型回答忠实性的方法及系统,涉及人工智能技术领域,该方法包括:采用大语言模型基于上下文生成问题的长文本回答和短文本回答;采用短文本精准奖励函数计算所述短文本回答的第一奖励分值;采用长文本代理奖励函数计算所述长文本回答的第二奖励分值;采用格式奖励函数计算所述长文本回答和所述短文本回的第三奖励分值;将所述第一奖励函数、第二奖励函数和第三奖励函数相加,得到最终奖励函数;基于所述最终奖励函数引导所述大语言模型生成既忠实于上下文又符合结构化格式要求的回答,有助于解决现有技术无法实现数据安全隔离与隐私保护,以及无法保障数据在整个流程中的安全性及合规使用的问题。
技术关键词
大语言模型
文本
非暂态计算机可读介质
格式
数据安全隔离
模块
人工智能技术
处理器
存储器
电子设备