一种基于细粒度传算协同的分布式大语言模型推理方法和装置
申请号:CN202510857284
申请日期:2025-06-25
公开号:CN120872521A
公开日期:2025-10-31
类型:发明专利
摘要
一种基于细粒度传算协同的分布式大语言模型推理方法和装置,其方法包括:(1)系统初始化,建立流水线并行推理架构;(2)实时监测系统,判断不同Micro‑Batch的推理阶段,监测节点间的网络状态;(3)采用加权优先级调度算法协调Prefill数据和Decode数据的传输;(4)采用自适应分块算法动态确定Prefi ll数据的最优分块大小。本发明通过加权优先级调度算法和自适应分块算法,实现Prefill数据和Decode数据传输和计算的细粒度协同,解决传输竞争问题。可以提升GPU利用率,降低请求推理时延,提高系统吞吐量,并能够根据网络条件动态调整传输策略,适用于各种分布式部署场景,具有广泛的应用价值。
技术关键词
大语言模型
推理方法
优先级调度算法
分块算法
实时监测系统
推理架构
数据
流水线
队列
系统吞吐量
推理装置
阶段
时延
网络
多设备
处理器
动态
节点数