摘要
本发明公开一种基于位置反思思维链的多模态大模型训练方法,包括以下步骤:S1、构建位置反思型思维链数据,通过区分思维链中数据提取与逻辑推理步骤,为前者关联图表视觉区域坐标,经绘图代码编辑、重渲染验证及图像分析技术自动化生成位置注释数据;S2、训练结构化推理模型,构建含视觉定位与逻辑推理的多类型指令数据集,采用多任务损失函数联合优化答案预测、位置定位及推理步骤生成,并通过边界框反思机制增强模型对图表元素的感知能力。本发明的方法有效解决现有模型依赖OCR导致的数值幻觉及思维链缺乏视觉交互问题,提升了图表理解准确性与思维链解释性,在主流基准上性能显著优于现有方法。