摘要
本发明提供大语言模型知识蒸馏的自然语言处理方法、装置及设备,涉及知识蒸馏技术领域。本发明能够通过在监督微调阶段,对教师模型的各中间层特征进行聚合和降维,与学生模型中间层特征对齐,将教师模型的各中间层特征动态映射到学生模型的各中间层。各中间层特征对齐后,基于教师模型与学生模型的中间层特征差异,构建损失函数,以此训练学生模型。由此,训练得到的学生模型不仅能够模仿教师模型的输出结果,还能够学习到教师模型的推理逻辑与决策路径等深层特征。学生模型能够学习到教师模型不同层次的特征信息,从而更好地理解和模仿教师模型的推理过程,提升了学生模型自然语言处理的准确率。