摘要
本发明提出一种面向混合博弈稀疏奖励的分布式多智能体强化学习方法,解决动作空间庞大、奖励稀疏及拟人性差的问题。通过多服务器部署游戏环境、AI服务器和强化学习训练器,搭建分布式训练框架,实现并行数据采集与梯度同步,提升训练效率。将复合动作拆分为移动、射门等独立子集,采用动作解耦PPO算法优化策略更新。基于生成对抗模仿学习训练判别器,生成模仿奖励并融合至总奖励,增强智能体拟人性。定义球员风格类别,定制差异化奖励函数,驱动智能体学习位置专属行为。构建包含自身、队友/敌人及全局状态的三级特征空间,利用交叉注意力机制捕获状态关联性,为工业级游戏AI的多智能体协作任务提供兼顾竞技强度与拟人性的高效解决方案。