摘要
本发明提供一种基于离线强化学习的策略制定方法及相关设备,获取数据集;其中,数据集包括:在不同时间段下通过同一单策略采集得到的数据、在同一时间段下通过不同单策略采集得到的数据、在不同时间段下通过同一策略组合采集得到的数据、在同一时间段下通过不同策略组合采集得到的数据;根据数据集生成多个元组,根据各个元组构建相应的价值函数,并利用价值函数和各个元组构建相应的策略模型;通过智能体利用待测小区执行当前策略得到的当前状态、当前动作和当前奖励预测待测小区的下一状态,并根据当前状态、当前动作、当前奖励和待测小区的下一状态,预测下一动作;利用下一动作更新当前策略,得到待测小区的业务保障策略。