摘要
本申请实施例公开了一种驾驶策略模型训练方法、自动驾驶方法及相关装置。每组训练数据包括车辆行驶过程的环境信息、驾驶行为策略以及环境信息对应的标注信息,环境信息包括在车辆行驶过程采集的环境语音信号以及环境存在物信号,标注信息包括对驾驶行为策略的评价标注,基于训练数据对奖励模型进行训练,并基于训练好的奖励模型、通过强化学习的方式对决策模型进行训练。模型可以基于环境语音信号等多种信息进行驾驶行为决策,决策时所依据的数据源更多,可以提升决策准确性,通过强化学习的方式训练决策模型对不同环境和场景的驾驶行为决策能力,使得模型针对任意的场景,尤其是发生概率较低的长尾场景均能输出合适的驾驶行为策略。