摘要
本发明适用于GPU管理领域,提供了一种GPU算力的智能动态管理方法及云平台,所述方法包括以下步骤:采集任务数据及GPU状态数据并结合调度插件生成任务队列和资源分配策略;基于任务队列和GPU实时负载,通过强化学习动态调整资源分配比例来分析任务依赖关系并生成迁移计划;根据任务依赖关系和GPU通信拓扑进行通信路径的优化和异步传输延迟的调整,并输出同步状态标记;结合同步状态和GPU硬件状态监控异常,依据迁移计划执行热迁移且进行显存回收,并更新资源空闲列表。本发明通过算法创新与硬件协同优化,实现了多GPU系统中资源调度的智能化、动态化和高效化。