摘要
本发明公开了一种基于强化学习的传染病干预措施优化方法,包括:对改进型Covasim环境进行参数调整;对智能体进行训练:(1)智能体从改进型Covasim环境获取状态信息st,在感染人数超过预设人数阈值时,根据状态信息输出干预措施强度值at,根据at作用于环境并得到对应的奖励信息rt,获取下一状态信息st+1,将数据组(st,at,rt,st+1)存至经验回放区;(2)当经验回放区中存储的数据达到预设数据阈值后随机采样Mini‑batch对智能体的网络参数进行更新;(3)重复步骤(1)‑(2)直至达到预设最大训练时长,得到训练后的智能体;训练后的智能体根据当前传染病疫情状态输出对应的干预措施。