一种存算分离场景下大语言模型GPT-2拉远训练方法

申请号：CN202511317506

申请日期：2025-09-16

公开号：CN120806176B

公开日期：2025-11-14

类型：发明专利

摘要

本发明提供了一种存算分离场景下大语言模型GPT‑2拉远训练方法，属于人工智能和云计算技术领域。该方法包括：客户端与服务端建立通信连接；客户端对数据进行序列化，经过序列化的数据通过网络传输发送至服务端；服务端主进程创建数据接收线程用于数据接收和发送反馈，服务端接收到的数据被存入共享队列；建立服务端多进程分布式并行训练模型，各进程从共享队列中取数据用于模型训练，数据接收线程在训练的同时可以接收数据，实现训练和接收并行执行；持续进行数据传输和训练任务，直到完成指定的训练轮次或满足终止条件。本发明通过存算分离场景实现大语言模型训练和数据接收并行执行，提高训练效率，提升模型性能。

技术关键词

服务端建立通信客户端进程队列注意力场景拓扑结构信息滑动窗口机制字节流更新模型参数分布式训练显卡设备台式主机大语言模型端口多层感知机传送数据分词