Skip to main content
QUICK REVIEW

[論文レビュー] A Survey of Deep Reinforcement Learning Algorithms for Motion Planning and Control of Autonomous Vehicles

Fei Ye, Shen Zhang|arXiv (Cornell University)|May 29, 2021
Reinforcement Learning in Robotics参考文献 72被引用数 6
ひとこと要約

本調査は、自律走行車の運動計画および制御における深層強化学習(DRL)の応用を体系的にレビューし、パイプライン型とエンドツーエンド型のアプローチを比較している。DRLが人為的ラベルなしに試行錯誤から学習できること、エンドツーエンド手法が優れた性能とコンactなシステム設計を実現できることを強調するとともに、シミュレーションから実世界への転送、一般化、エキスパートデータの不足が主な課題であると指摘し、今後の研究分野として継続的学習およびメタラーニングを示している。

ABSTRACT

In this survey, we systematically summarize the current literature on studies that apply reinforcement learning (RL) to the motion planning and control of autonomous vehicles. Many existing contributions can be attributed to the pipeline approach, which consists of many hand-crafted modules, each with a functionality selected for the ease of human interpretation. However, this approach does not automatically guarantee maximal performance due to the lack of a system-level optimization. Therefore, this paper also presents a growing trend of work that falls into the end-to-end approach, which typically offers better performance and smaller system scales. However, their performance also suffers from the lack of expert data and generalization issues. Finally, the remaining challenges applying deep RL algorithms on autonomous driving are summarized, and future research directions are also presented to tackle these challenges.

研究の動機と目的

  • 自律走行車の運動計画および制御における深層強化学習(DRL)の応用を包括的にレビューすること。
  • 自律走行システムにおけるパイプライン型とエンドツーエンド型DRLアプローチの性能、スケーラビリティ、制限要因を比較すること。
  • DRLを現実世界の自律走行に適用するにあたり、特にシミュレーションから実世界への転送とデータ効率性の面で生じる主な課題を特定すること。
  • 一般化および適応性を向上させるため、継続的学習およびメタラーニングを含む今後の研究分野を検討すること。

提案手法

  • 既存のDRLベースの運動計画および制御手法を階層的(パイプライン)型とエンドツーエンド型のフレームワークに分類する。
  • 調査対象の研究における、状態空間、行動空間、報酬関数設計の具体的なDRLアルゴリズムを分析する。
  • ドメインランダマイゼーションおよび適応技術を用いて、シミュレーションと実世界の間のギャップを埋めるために、シミュレーションから実世界への転送性能を評価する。
  • サンプル効率性およびポリシーの一般化を向上させるために、模倣学習および報酬設計の工夫を検討する。
  • 新しい走行シナリオに迅速に適応できるようにするため、継続的学習およびメタラーニングを有望な戦略として提案する。
  • 主要な構成要素および設計選択の構造的要約表(表I)を用いて、研究間のアルゴリズム的定式化を比較する。
Figure 1: An illustration of the pipeline and the end-to-end approach for motion planning and control of autonomous vehicles, figure adapted from [ 2 ] .
Figure 1: An illustration of the pipeline and the end-to-end approach for motion planning and control of autonomous vehicles, figure adapted from [ 2 ] .

実験結果

リサーチクエスチョン

  • RQ1自律走行車制御におけるパイプライン型とエンドツーエンド型のDRLアプローチは、性能およびシステムの複雑さにおいてどのように比較されるか?
  • RQ2シミュレーションで訓練されたDRLポリシーを実世界の自律走行車に展開するにあたり、主な課題は何か?
  • RQ3ドメインランダマイゼーションおよびドメイン適応技術は、DRLベースの運動計画におけるシミュレーションから実世界への一般化をどの程度向上させられるか?
  • RQ4継続的学習およびメタラーニングは、多様な走行タスクにわたるDRLエージェントの一般化および適応性をどのように向上させ得るか?
  • RQ5報酬関数設計および状態/行動空間の表現は、自律走行車の意思決定におけるDRLの成功にどのような役割を果たすか?

主な発見

  • エンドツーエンド型DRLアプローチは、パイプライン全体を一括最適化することで、手作業で設計されたモジュールに起因するボトル neck を回避し、より優れた性能と小型のシステムスケールを達成している。
  • 高いサンプル複雑性があるにもかかわらず、DRLは明示的な人為的ラベルに依存せず、環境との相互作用から得られる報酬信号に基づいて学習を可能としている。
  • シミュレーションから実世界への転送は依然として大きな課題であり、ドメインランダマイゼーションや適応技術を用いないと、シミュレーションで訓練されたポリシーは実世界の状況に一般化されにくい。
  • パイプライン型アプローチは、データの増加に伴い改善されない手作業で設計された抽象化に起因し、最終的には性能のボトル neck となる。
  • 現在のDRL手法は主にタスク固有であり、データ効率性に欠けるため、各新しいシナリオに対して再訓練が必要であり、これに伴い、転送学習およびメタラーニングの必要性が浮き彫りになっている。
  • ドメインランダマイゼーションおよび模倣学習は、ポリシーの一般化を向上させ、シミュレーションから実世界へのドメインギャップを低減する上で有望であると示されている。
Figure 2: Carla environments: Hard Rainy in Town 1 [ 39 ] .
Figure 2: Carla environments: Hard Rainy in Town 1 [ 39 ] .

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。