摘要
本公开实施例公开了一种导诊模型的训练方法、装置、存储介质以及程序产品。其方法包括:从诊前对话数据中提取问题数据;基于诊中数据获取参考标准答案;将问题数据分别输入到协同模型和基础模型中以获取不同答复,结合问题数据和参考标准答案构建偏好数据;基于诊中数据生成虚拟QRA数据集微调基础模型得参考模型;引入安全约束规则,结合偏好数据和参考模型训练导诊模型得期望模型。该方法能够在导诊模型强化学习阶段引入安全约束规则,明确“安全红线”,保障导诊模型输出安全可控,相较于传统的仅用导诊模型与基础模型构建偏好数据的DPO训练法,该方法多引入了协同模型,使数据更多样,让导诊模型在训练中能够学习更广泛的人类偏好模式。