Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Human-Like Driving Policies in Collision Avoidance Tasks of Self-Driving Cars

Ran Emuna, Avinoam Borowsky|arXiv (Cornell University)|Jun 7, 2020
Autonomous Vehicle Technology and Safety参考文献 42被引用数 21
ひとこと要約

本論文は、2車線の高速道路における静的障害物回避タスクにおいて、専門家による人間の運転行動を模倣するモデルフリーの深層強化学習(DRL)手法を提案する。確率的報酬関数を用いてルールベースの運転制約とデータ駆動型の専門家デモンストレーションを統合することで、人間の運転ポリシーに類似した行動を生成し、人間の軌道位置および速度分布の平均と分散をよく再現し、視覚的チューリングテストにおいて人間に近い性能を達成した。

ABSTRACT

The technological and scientific challenges involved in the development of autonomous vehicles (AVs) are currently of primary interest for many automobile companies and research labs. However, human-controlled vehicles are likely to remain on the roads for several decades to come and may share with AVs the traffic environments of the future. In such mixed environments, AVs should deploy human-like driving policies and negotiation skills to enable smooth traffic flow. To generate automated human-like driving policies, we introduce a model-free, deep reinforcement learning approach to imitate an experienced human driver's behavior. We study a static obstacle avoidance task on a two-lane highway road in simulation (Unity). Our control algorithm receives a stochastic feedback signal from two sources: a model-driven part, encoding simple driving rules, such as lane-keeping and speed control, and a stochastic, data-driven part, incorporating human expert knowledge from driving data. To assess the similarity between machine and human driving, we model distributions of track position and speed as Gaussian processes. We demonstrate that our approach leads to human-like driving policies.

研究の動機と目的

  • 混合交通環境における熟練した人間ドライバーの行動を模倣する自己走行車ポリシーを開発すること。
  • 実際のドライブデータから得られるデータ駆動型の専門家知識と、ルールベースの運転制約(例:レーンキーピング、速度制御)を統合すること。
  • 運動学的特徴の統計的分布を用いて、機械と人間の運転行動の類似度を評価すること。
  • 学習済みポリシーの一般化能力を、未確認の障害物分布を持つ新たな道路構成でテストすること。
  • 機械が運転するエージェントが、観察者に人間らしく見えるかどうかを視覚的チューリングテストで評価すること。

提案手法

  • プロキシマルポリシー最適化(PPO)を用いて、モデル駆動のルールとデータ駆動の専門家行動を組み合わせたハイブリッド報酬関数で、深層強化学習エージェントを訓練する。
  • 報酬関数は、2つのソースからの確率的フィードバックを組み込む:ルールベースのコンponents(例:レーンキーピング、速度制御)と、軌道位置および速度のガウス過程モデリングによる人間専門家データ。
  • 人間ドライブの状態分布は、平均行動とばらつき(一次モーメントと二次モーメント)を捉えるためにガウス過程を用いてモデリングされる。
  • シミュレーション環境はUnityで構築され、任意の位置に静的障害物が配置された4.7 kmの2車線高速道路を含む。
  • 視覚的チューリングテストは、2019年イスラエルロボティクス会議(ICR 2019)で実施され、参加者が人間とエージェントのドライブ記録動画を視聴し、どちらが人間であるかを識別した。
  • 一般化性能は、交互に配置、ランダム、バッチ化された障害物を含む、障害物分布が異なる新たなレーンで評価された。

実験結果

リサーチクエスチョン

  • RQ1深層強化学習エージェントは、静的障害物回避タスクにおいて、人間ドライブ行動の平均と分散を再現できるか?
  • RQ2専門家データからの確率的フィードバックを組み込むことで、新しい障害物分布へのポリシーの一般化性能は向上するか?
  • RQ3機械が運転するエージェントは、観察者に人間らしく見える程度まで、視覚的チューリングテストに合格できるか?
  • RQ4訓練時に見られなかった高カーブ路線のような新規シナリオでは、エージェントはどの程度の性能を示すか?
  • RQ5ルールベースの制約とデータ駆動型の専門家知識の相対的寄与度は、人間らしさのある運転行動を達成するためにどの程度か?

主な発見

  • エージェントは、特に軌道位置において、人間ドライブ行動の一次モーメントと二次モーメントを効果的に再現したが、部分的観測性のため速度の一致はやや不正確であった。
  • 確率的報酬関数を用いることで、決定論的報酬関数よりも優れた一般化性能が得られ、多様な障害物分布を持つ新たな道路でもすべての障害物を回避できた。
  • ICR 2019で実施された視覚的チューリングテストでは、参加者の60%が機械が運転するエージェントを正しく特定できなかったため、強い人間らしさが確認された。
  • 訓練データに存在しなかった高カーブ路線では、エージェントは障害物を回避できず、著しい新規シナリオへの一般化能力の限界が示された。
  • 本手法は、確率的報酬関数を介してルールベースの制約とデータ駆動型の専門家知識を統合することで、シミュレーション上で効果的で人間らしさのある運転ポリシーを生成できることを示した。
  • 特定のハイパーパrameter(例:学習率1e-1、割引率γ=0.98、クリッピングε=0.2)を用いたPPOによるハイパーパrameterチューニングにより、安定した訓練とポリシー収束が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。