摘要
本发明涉及多智能体强化学习领域,其公开了一种基于因果推理和分层注意力机制的强化学习方法,弥补传统多智能体系统中角色分配不准确和协作效率低下的缺陷,提升整体协作性能。该方法通过构建因果感知的多智能体协作模型,首先利用结构因果模型构建动态因果图,利用优化变分分布估计器计算智能体间的因果影响力向量;然后基于因果影响力向量生成因果引导的分层注意力权重;接着通过跨智能体注意力共享机制实现协作信息传递,利用跨层融合机制生成增强特征表示;进一步基于全局因果贡献度和局部因果贡献度设计因果感知角色选择器,实现智能体角色的动态分配;最后通过因果影响内在奖励机制进行模型训练优化。