一种基于设备需求感知的跨GPU显存动态调度系统及方法
申请号:CN202511115047
申请日期:2025-08-11
公开号:CN121029392A
公开日期:2025-11-28
类型:发明专利
摘要
本发明公开了一种基于设备需求感知的跨GPU显存动态调度系统及方法,属于计算机科学人工智能领域,适用于大语言模型的分布式推理场景。本发明包括:针对PD分离架构中显存资源利用不均衡和跨设备通信瓶颈的问题,系统在预填充实例构建显存交换区,当解码实例的显存占用临界时,将部分KV缓存迁移至交换区,并在资源允许时回迁,以充分利用预填充实例闲置的显存资源,缓解解码阶段的显存压力。系统通过GPU间直连建立的高速通信路径,实现由原CPU中转的低效KV缓存迁移过程向GPU直访模式的转化。迁移过程采用分层的异步传输策略,将通信开销隐藏在计算流水线中,降低迁移延迟,实现跨GPU显存的共享复用与高效调度。
技术关键词
动态调度系统
解码
中央控制器
计算机科学人工智能
CUDA接口
共享通道
队列
调度器
系统启动阶段
动态调度方法
跨进程
模块
资源
拷贝
高速通信
流水线
数据访问
设备通信
逻辑