Skip to main content
QUICK REVIEW

[論文レビュー] Autonomous Driving with Deep Reinforcement Learning in CARLA Simulation

Jumman Hossain|arXiv (Cornell University)|Jun 20, 2023
Autonomous Vehicle Technology and SafetyEngineering被引用数 3
ひとこと要約

本論文は、CARLAシミュレーション環境において高速走行時の車線維持と衝突回避を実現する自律走行車両のための、Deep Q-Network (DQN) を用いた強化学習手法を提案する。この手法は、生のセンサ観測値を入力として用い、エンドツーエンドの学習によりポリシーを学習し、ランダムベースラインと比較して衝突率を68%低減し、平均速度は8.71 km/hを達成した。これは、多様な天候および交通状況下でも有効である。

ABSTRACT

Nowadays, autonomous vehicles are gaining traction due to their numerous potential applications in resolving a variety of other real-world challenges. However, developing autonomous vehicles need huge amount of training and testing before deploying it to real world. While the field of reinforcement learning (RL) has evolved into a powerful learning framework to the development of deep representation learning, and it is now capable of learning complicated policies in high-dimensional environments like in autonomous vehicles. In this regard, we make an effort, using Deep Q-Learning, to discover a method by which an autonomous car may maintain its lane at top speed while avoiding other vehicles. After that, we used CARLA simulation environment to test and verify our newly acquired policy based on the problem formulation.

研究の動機と目的

  • 複雑な高速道路環境において、自律走行車両が高車速を維持しながら衝突を回避できる深層強化学習ポリシーの開発。
  • CARLAにおける車線維持と衝突回避に特化した、カスタム設計の観測、行動、報酬定式化の設計。
  • 複数の町、天候条件、交通密度において、訓練済みDQNエージェントの性能評価。
  • 学習効果の妥当性を検証するため、固定されたランダム重みベースライン(U)と比較して、訓練済みDQNエージェント(S)の性能を評価。
  • CARLAにおける未確認の環境およびシナリオにおけるDQNポリシーの一般化能力の評価。

提案手法

  • エージェントは、生のカメラおよびLiDARに類似したセンサ観測値を入力状態表現として用い、畳み込みニューラルネットワークで処理する。
  • 経験再生とターゲットネットワークの更新を用いて、DQNを訓練することで、学習の安定化と時系列相関の低減を図る。
  • 行動空間は、スロットル、ブレーキ、ステアリング角度の離散的制御命令から構成され、エンドツーエンド制御のための離散的行動にマッピングされる。
  • 密度の高い報酬関数を設計し、20–30 km/hの範囲内で高速走行を奨励し、衝突をペナルティ化し、目的への進行を報酬化する。
  • 訓練は、標準的な天候条件のTown04で実施され、評価は8つの町および2つの天候セット(簡単および困難)で実施される。
  • 性能評価には4つの指標を用いる:衝突率、平均速度、全エピソード報酬、障害発生までのタイムステップ数。
Figure 1: Agent-Environment Interaction in Reinforcement learning
Figure 1: Agent-Environment Interaction in Reinforcement learning

実験結果

リサーチクエスチョン

  • RQ1生のセンサ入力のみを用いて、シミュレーテッド高速道路環境で、高車速かつ衝突のない車線維持ポリシーをDQNエージェントが学習できるか?
  • RQ2訓練済みDQNエージェントの性能は、固定されたランダムベースラインと比較して、衝突率、速度、報酬の観点でどのように異なるか?
  • RQ3CARLAにおける異なる町、天候条件、交通密度において、DQNポリシーの一般化能力はどの程度か?
  • RQ4報酬設計が、安全で高車速走行行動への誘導に効果的に機能しているか?
  • RQ5累積エピソード報酬の観点から、DQN学習プロセスの収束特性はいかなるものか?

主な発見

  • 訓練済みDQNエージェント(S)は、すべてのテストシナリオで68%の衝突率を達成し、未訓練ベースライン(U)の96%と比べて顕著に低い。
  • DQNエージェントはテストシナリオで平均8.71 km/hの速度を維持したが、未訓練ベースラインは6.10 km/hであった。これは、同じ条件下で性能が向上していることを示している。
  • DQNエージェントの全エピソード報酬は平均1954であり、未訓練ベースラインの513を大幅に上回り、効果的なポリシー学習が実現したことを示している。
  • DQNエージェントは1エピソードあたり平均373タイムステップを維持して衝突や障害が発生するまでに至ったが、未訓練ベースラインは241であった。これは、より高いポリシー安定性を示している。
  • 累積報酬曲線は、約3000ステップ目以降に上行傾向を示し、安定したポリシー学習が行われていることを示している。
  • ポリシーは、複数の町(Town01からTown10)、天候プリセット(WetCloudySunsetおよびHardRainNoonを含む)、交通密度(なし、通常、密集)において一般化能力を示した。
Figure 2: Q-table.
Figure 2: Q-table.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。