摘要
本发明涉及一种基于网络防御智能体的决策方法,涉及网络安全领域,本发明基于网络设备的连接关系构建网络系统拓扑图;利用生成的西格玛规则来在网络系统拓扑图的节点上匹配符合节点属性的网络威胁,从而自动构建出对应网络系统拓扑图中任意节点的攻击动作空间;构建多个攻击智能体和防御智能体;智能体包含决策网络和评价网络;决策网络根据其所观察的局部网络环境状态来给出动作概率,并根据动作概率选择动作;评价网络基于所有攻击智能体观察的联合网络环境状态进行评估得到策略或执行动作的价值;利用强化学习训练攻击智能体和防御智能体,利用训练的防御智能体进行网络防御决策,以应对动态的网络攻击。