摘要
本申请公开了一种问答任务处理模型训练方法、装置、设备及介质,涉及自然语言处理技术领域,包括:从训练样本问题中提取若干关键结构要素,并利用每一关键结构要素引导当前问答任务处理模型生成对应的初始推理路径;将每一初始推理路径作为根节点,并基于初始推理路径中各词元位置的信息熵确定分叉节点,然后在分叉节点生成分支推理路径以得到扩展推理树;计算扩展推理树中各节点的节点价值,并进一步计算全局优势、局部优势和路径残差;利用基于全局优势、局部优势和路径残差确定的奖励值对当前问答任务处理模型进行训练,最终通过多轮迭代以得到训练好的目标问答任务处理模型,以利用目标问答任务处理模型对获取到的待处理问答任务进行处理。