基于视觉交互的多模态数据标注与大模型思维链训练方法
申请号:CN202511053014
申请日期:2025-07-30
公开号:CN120562596B
公开日期:2025-11-21
类型:发明专利
摘要
本发明属于大模型训练领域,具体涉及一种基于视觉交互的多模态数据标注与大模型思维链训练方法。该方法包括以下步骤:1、多模态数据采集;2、将多模态数据显示到显示器上,通过显示器将多模态数据展示给专家,采用眼动数据采集设备记录专家观看显示器上多模态数据时的眼动轨迹,并且采用语音采集设备采集专家的语音信息;3、根据眼动轨迹和语音信息,形成多模态标注数据;4、对多模态标注数据进行预处理后,再将其输入至大模型进行训练,得到训练好的大模型。本发明能够采集专家在标注过程中的多模态标注数据,将专家的思维链和思维过程进行显性化处理,并进行逻辑融合,提升大模型的信息广度和准确度。
技术关键词
语音采集设备
文本特征向量
图像特征向量
多模态数据采集
显示器
眼动数据
注视点
图片
视觉特征
BERT模型
眼动轨迹
图像类别