[论文解读] Navigation In Urban Environments Amongst Pedestrians Using Multi-Objective Deep Reinforcement Learning
本文提出一种基于阈值分层Q-learning的多目标深度强化学习方法,以提升城市环境中行人存在下的自主导航性能。通过分别训练安全与速度目标的独立智能体,并融合其策略,该方法在已知与未知环境中均实现了100%无碰撞性能,且制动次数减少,优于所有指标上的单目标DQN基线模型。
Urban autonomous driving in the presence of pedestrians as vulnerable road users is still a challenging and less examined research problem. This work formulates navigation in urban environments as a multi objective reinforcement learning problem. A deep learning variant of thresholded lexicographic Q-learning is presented for autonomous navigation amongst pedestrians. The multi objective DQN agent is trained on a custom urban environment developed in CARLA simulator. The proposed method is evaluated by comparing it with a single objective DQN variant on known and unknown environments. Evaluation results show that the proposed method outperforms the single objective DQN variant with respect to all aspects.
研究动机与目标
- 为解决在行人存在、安全与速度目标相互冲突的复杂城市环境中实现自主导航的挑战。
- 克服单目标强化学习的局限性,后者使用标量奖励,难以有效平衡碰撞规避与速度等冲突目标。
- 开发一种多目标深度强化学习框架,分别学习安全与速度的独立策略,再将其融合为统一的决策策略。
- 在已知与未知城市环境中评估该方法,以检验其鲁棒性与泛化能力。
- 证明多目标学习可实现比单目标方法更安全、更平顺、更高效的导航。
提出的方法
- 该方法采用具有独立安全与速度目标奖励向量的多目标马尔可夫决策过程(MOMDP)。
- 使用一种阈值分层Q-learning变体,其中安全优先于速度,确保在优化速度前始终满足碰撞规避要求。
- 训练两个智能体:一个使用卷积神经网络(CNN)处理状态,另一个使用长短期记忆网络(LSTM)建模时间依赖性与行人意图。
- 两个智能体分别使用各自的Q函数处理每个目标,Q值通过深度神经网络近似,以实现高维状态空间下的可扩展性。
- 最终策略通过组合两个智能体的输出获得,确保优先执行安全策略,随后进行速度优化。
- 训练在CARLA仿真器中构建的自定义城市环境中进行,包含逼真的行人行为与交通规则。
实验结果
研究问题
- RQ1多目标深度强化学习方法是否能在城市环境中行人存在的情况下,优于单目标DQN?
- RQ2与基于标量奖励的方法相比,使用阈值分层Q-learning在提升安全性和驾驶平顺性方面有何改善?
- RQ3引入基于LSTM的智能体在速度、停车行为与行人距离保持方面的性能提升程度如何?
- RQ4所提出方法在CARLA中的未见城市环境(如Town01与Town04)中表现如何?
- RQ5多目标框架是否在保持无碰撞导航的同时减少了不必要的制动?
主要发现
- 多目标DQN智能体在已知与未知环境中均实现了100%无碰撞的episode,优于单目标DQN在已知环境中的97%与98%,以及未知环境中的95%与97%。
- 在未知环境中,多目标智能体将平均停车次数从单目标的11.51次减少至5.99次,表明驾驶行为更平顺、更自然。
- 在未知环境中,多目标智能体的成功率达到98%,高于单目标智能体的95%,表明其泛化能力更强。
- 多目标智能体在未知环境中与最近行人保持平均0.75米距离(在2米范围内),显著高于单目标智能体的0.41米,表明安全裕度更高。
- 在未知环境中,多目标智能体的平均速度达到5.98 m/s,优于单目标智能体的3.43 m/s,表明安全与速度可被有效平衡。
- 基于LSTM的智能体变体在所有指标上均优于仅使用CNN的变体,尤其在减少停车次数与改善过街时长方面表现更优,凸显记忆机制在意图预测中的优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。