摘要
本申请涉及一种模型训练任务执行方法、图形处理器和模型训练系统,其中,该模型训练任务执行方法包括:在对当前文本段执行模型前向传播的注意力计算时,从中央处理器中依次加载各前序文本段所对应的键值对激活值进行注意力计算;同时将当前文本段所对应的键值对激活值卸载至中央处理器;在对当前文本段执行模型反向传播的注意力计算时,从中央处理器中加载当前文本段所对应的前向传播输出结果和键值对激活值,并依次加载各前序文本段所对应的注意力激活值,与当前文本段所对应的前向传播输出结果和键值对激活值进行注意力计算,得到梯度值;将梯度值卸载至中央处理器中;其能够在GPU资源受限情况下,提高大语言模型的文本训练任务的执行效率。