基于大语言模型的上下文偏好学习方法、装置及设备

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
基于大语言模型的上下文偏好学习方法、装置及设备
申请号:CN202511097420
申请日期:2025-08-06
公开号:CN120996133A
公开日期:2025-11-21
类型:发明专利
摘要
本发明涉及一种基于大语言模型的上下文偏好学习方法、装置及设备,方法包括:配置任务环境并定义性能指标;通过大语言模型自动生成多组初始奖励函数;并行训练多个强化学习代理并采集行为数据;基于加权评分机制自动识别最优与最劣奖励函数;结合对比差异信息驱动大语言模型生成改进函数并迭代优化。本方案能够突破人工设计瓶颈,实现奖励函数的动态权重调节与跨场景泛化;在客服、工业控制等场景中显著提升决策效率与安全性;通过无监督偏好评估降低人工成本,支持策略模型持续自适应优化。
技术关键词
强化学习代理 大语言模型 学习方法 评分机制 指标 情感分析模型 计算机设备 学习装置 人类 策略 处理器 无监督 定义 决策 存储器 控制模块 场景 客服 动态