摘要
本发明涉及一种用于人群自适应行为仿真的分层强化学习方法,通过基于智能体在人群中的当前位置、目标点和环境结构构建其在静态封闭环境下的静态规划最优路径,并生成该智能体自当前位置点朝目标点移动的目标趋向速度,建立激光雷达观测数据到碰撞避免速度的非线性映射并基于智能体周身环境提供动态避障指引,根据智能体周围人员分布信息分别动态调整目标趋向速度权重和碰撞避免速度权重,并根据智能体当前的目标趋向速度、调整后目标趋向速度权重值、目标趋向速度权重调整值及调整后碰撞避免速度权重值做速度加权耦合,得到智能体自适应行走速度。如此,完成了在智能体不引起局部碰撞情况下实现全局路径优化,提高了强化学习效率。