摘要
本发明涉及医疗信息处理领域,公开了基于互联网医院医疗对话和病历的强化学习与协同系统,完整对话链获取模块,用于获取每轮“患者输入‑大模型回复‑医生修改”的完整对话链;反馈格式构建模块,基于完整对话链,构建结构化反馈格式,作为强化学习的训练样本,所述结构化反馈格式包括输入内容,原始回复,医生编辑内容,编辑行为标签,语义差异分;强化学习优化模块,用于在已有监督微调模型基础上,引入强化学习算法PPO,基于所述训练样本,执行面向医疗对话系统的强化学习优化。本发明的方法可以解决现有医疗问诊对话系统中存在的响应缺乏推理透明性、模型不可持续优化、医生反馈未被利用、系统请求压力不可控等问题。