摘要
本发明公开了一种有限资源下大规模MoE模型本地推理加速系统及方法,进行大语言模型推理设备上的MoE模型性能建模,得到模块传算性能模型;执行滑动窗口式贪婪预测‑调度策略:利用MoE模型中的门控网络进行专家模块路由预测,得到各层的激活专家及各专家的输入token,并利用所述模块传算性能模型结合最小滑动窗口算法动态地决定单次调度窗口中所包含的MoE模型层数;根据预测的所述专家模块路由,对单次调度窗口长度的窗口内的激活专家模块进行最优执行策略搜索和进行所述MoE模型层调度。本发明通过无训练成本的专家激活预测机制,实现高效、稳定的本地大模型推理部署。