[論文レビュー] Navigation In Urban Environments Amongst Pedestrians Using Multi-Objective Deep Reinforcement Learning
本稿では、歩行者を伴う都市環境における自律走行の向上を目的として、しきい値付きレクシコグラフィックQ学習を用いたマルチオブジェクティブ深層強化学習手法を提案する。安全と速度の両目標を別々のエージェントで学習し、その方策を統合することで、既知および未知の環境において100%衝突なしの性能を達成するとともに、ブレーキングを低減した。この手法は、全指標において単目的DQNベースラインを上回った。
Urban autonomous driving in the presence of pedestrians as vulnerable road users is still a challenging and less examined research problem. This work formulates navigation in urban environments as a multi objective reinforcement learning problem. A deep learning variant of thresholded lexicographic Q-learning is presented for autonomous navigation amongst pedestrians. The multi objective DQN agent is trained on a custom urban environment developed in CARLA simulator. The proposed method is evaluated by comparing it with a single objective DQN variant on known and unknown environments. Evaluation results show that the proposed method outperforms the single objective DQN variant with respect to all aspects.
研究の動機と目的
- 複雑な都市環境における歩行者を伴う自律走行の課題に取り組むこと。この場合、安全と速度は対立する目標である。
- スカラー報酬を用いる単目的強化学習の限界を克服すること。これは、衝突回避と速度という対立する目標をうまくバランスできない。
- 安全と速度のための別々の方策を学習するマルチオブジェクティブ深層強化学習フレームワークを開発し、それらを統合された意思決定方策に統合すること。
- 本手法のロバストネスと一般化性能を評価するために、既知および未知の都市環境で評価すること。
- マルチオブジェクティブ学習が、単目的手法に比べてより安全で滑らかで、かつ効率的な走行を実現することを示すこと。
提案手法
- 安全と速度の両目標に対して別々の報酬ベクトルを有するマルチオブジェクティブMDP(MOMDP)を採用する。
- しきい値付きレクシコグラフィックQ学習の変種を用い、安全が速度よりも優先され、衝突回避が常に満たされた後で速度最適化が行われる。
- 2つのエージェントを訓練する:1つは状態処理にCNNを、もう1つは時間的依存性および歩行者の意図をモデル化するためのLSTMを用いる。
- 両目標それぞれに対して別々のQ関数を用い、高次元状態空間におけるスケーラビリティを確保するため、Q値は深層ニューラルネットワークで近似する。
- 最終的な方策は、両エージェントの出力を統合することで得られ、安全確保が最優先され、その後で速度最適化が行われる。
- 訓練は、現実的な歩行者行動と交通ルールを備えた、CARLAシミュレータ上に構築されたカスタム都市環境で実施される。
実験結果
リサーチクエスチョン
- RQ1マルチオブジェクティブ深層強化学習アプローチは、歩行者を伴う都市環境における自律走行において、単目的DQNを上回ることができるか?
- RQ2しきい値付きレクシコグラフィックQ学習の使用は、スカラー報酬ベースの手法に比べて、安全性と走行の滑らかさをどのように向上させるか?
- RQ3LSTMベースのエージェントを組み込むことで、速度、停止行動、歩行者との距離維持の観点でどの程度性能が向上するか?
- RQ4本手法は、CARLAのTown01やTown04のような未知の都市環境にどの程度一般化できるか?
- RQ5マルチオブジェクティブフレームワークは、衝突なしの走行を維持しながら、不要なブレーキングを低減できるか?
主な発見
- マルチオブジェクティブDQNエージェントは、既知および未知の両環境で100%衝突なしのエピソードを達成した。一方、単目的DQNは、既知環境で97%、未知環境で95%の衝突なし率を示した。
- 未知環境では、マルチオブジェクティブエージェントの平均停止回数は、単目的エージェントの11.51回から5.99回に低下し、より滑らかで自然な走行行動を示した。
- 未知環境では、マルチオブジェクティブエージェントの成功確率は98%であったのに対し、単目的エージェントは95%であった。これは、より優れた一般化性能を示している。
- マルチオブジェクティブエージェントは、最近接歩行者までの平均距離を0.75m(2m以内)に維持したが、単目的エージェントは0.41mであった。これは、より高い安全性マージンを示している。
- 未知環境における平均速度は、マルチオブジェクティブエージェントで5.98 m/s、単目的エージェントで3.43 m/sであった。安全と速度の両立が効果的に実現されたことを示している。
- LSTMベースのエージェントバージョンは、すべての指標でCNNオンリーバージョンを上回り、特に停止回数の低減と横断時間の改善において顕著な効果を示した。これは、意図予測に記憶機能が有効であることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。