一种基于细粒度传算协同的分布式大语言模型推理方法和装置

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
一种基于细粒度传算协同的分布式大语言模型推理方法和装置
申请号:CN202510857284
申请日期:2025-06-25
公开号:CN120872521A
公开日期:2025-10-31
类型:发明专利
摘要
一种基于细粒度传算协同的分布式大语言模型推理方法和装置,其方法包括:(1)系统初始化,建立流水线并行推理架构;(2)实时监测系统,判断不同Micro‑Batch的推理阶段,监测节点间的网络状态;(3)采用加权优先级调度算法协调Prefill数据和Decode数据的传输;(4)采用自适应分块算法动态确定Prefi ll数据的最优分块大小。本发明通过加权优先级调度算法和自适应分块算法,实现Prefill数据和Decode数据传输和计算的细粒度协同,解决传输竞争问题。可以提升GPU利用率,降低请求推理时延,提高系统吞吐量,并能够根据网络条件动态调整传输策略,适用于各种分布式部署场景,具有广泛的应用价值。
技术关键词
大语言模型 推理方法 优先级调度算法 分块算法 实时监测系统 推理架构 数据 流水线 队列 系统吞吐量 推理装置 阶段 时延 网络 多设备 处理器 动态 节点数