摘要
本发明提供了一种基于多对多合同设计的分层联邦多任务学习方法,首先由多个智能体生成多个合同,并将合同经环境处理后传递给每个设备集合,集合根据动态规划算法选择效用最高的几份合同并反馈给环境,环境根据集合的选择模拟计算每个智能体的效用,并将平均效用作为奖励反馈给智能体。MAPPO算法根据上述步骤迭代,每一轮迭代智能体都会将经验存放到经验池中,直到迭代满足一定条件,智能体会从经验池中获取经验来更新动作网络和评论家网络。本发明实现了从“一对多”到“多对多”的激励扩展,更贴近真实场景,还使用MAPPO算法在复杂的动态博弈的场景下设计合同激励,这种激励机制极大地提高了在复杂、非平稳和信息不完全环境下的适应性和鲁棒性。