Skip to main content
QUICK REVIEW

[論文レビュー] Urban Driver: Learning to Drive from Real-world Demonstrations Using Policy Gradients

Oliver Scheel, Luca Bergamini|arXiv (Cornell University)|Sep 27, 2021
Autonomous Vehicle Technology and Safety被引用数 14
ひとこと要約

本論文では、100時間にわたる実世界のデモンストレーションから、複雑な都市ドライブポリシーを学習する最初のオフライン方策勾配法であるUrban Driverを提示する。中間レベルの表現とHDマップから構築された微分可能でデータ駆動型のシミュレータを活用することで、ポリシーの閉ループ学習を、オンポリシーのデータ収集を伴わずに実現可能にし、シミュレーションおよび自律走行車両における実世界でのデプロイで最先端の性能を達成した。

ABSTRACT

In this work we are the first to present an offline policy gradient method for learning imitative policies for complex urban driving from a large corpus of real-world demonstrations. This is achieved by building a differentiable data-driven simulator on top of perception outputs and high-fidelity HD maps of the area. It allows us to synthesize new driving experiences from existing demonstrations using mid-level representations. Using this simulator we then train a policy network in closed-loop employing policy gradients. We train our proposed method on 100 hours of expert demonstrations on urban roads and show that it learns complex driving policies that generalize well and can perform a variety of driving maneuvers. We demonstrate this in simulation as well as deploy our model to self-driving vehicles in the real-world. Our method outperforms previously demonstrated state-of-the-art for urban driving scenarios -- all this without the need for complex state perturbations or collecting additional on-policy data during training. We make code and data publicly available.

研究の動機と目的

  • 大規模な実世界のデモンストレーションから直接、スケーラブルでデータ駆動型の都市ドライブポリシー学習アプローチを開発すること。
  • 特に分布シフトに起因する共変量シフトや一般化性能の低さといった、都市環境におけるアシスト学習の限界を解消すること。
  • ヒューリスティックな摂動や手動で設計されたコスト関数に依存しない、閉ループでのエンドツーエンドのポリシー学習を可能にすること。
  • 学習済みポリシーの一般化性能と物理的自律走行車両への実世界デプロイを実証すること。
  • 時間的整合性を保ちつつ、ベクトル表現上で時間軸に沿ったバックプロパゲーションを用いて、高速な方策勾配計算を可能にする、スケーラブルで効率的なトレーニングパイプラインを提供すること。

提案手法

  • 実世界のデモンストレーションログと高精度なHDマップを用いて、新しい現実的ドライブエピソードを合成する微分可能でデータ駆動型のシミュレータを構築する。
  • シミュレータの入力として、中間レベルのベクトル表現(例:レーン構造、信号機、エージェントの軌道)を用いることで、効率的かつ微分可能なシミュレーションを実現する。
  • 長時間にわたるドライブ行動と補助的目標を最適化できるように、閉ループでポリシーネットワークを学習する方策勾配を採用する。
  • ベクトル表現と時間軸に沿ったバックプロパゲーションを活用することで、大規模データセット上でのトレーニングの複雑さを低減し、効率的な方策勾配の計算を実現する。
  • 微分可能シミュレータ内でのポリシーの展開を閉ループでアンロールするメカニズムを用い、時間的整合性を保ったエンドツーエンドのトレーニングを可能にする。
  • 既存のデモンストレーションから多様で現実的なシナリオをシミュレータが生成することで、オンポリシーのデータ収集や複雑な状態の摂動を回避する。

実験結果

リサーチクエスチョン

  • RQ1オンポリシーのデータ収集を伴わず、複雑な都市ドライブ環境におけるオフラインのアシスト学習に、方策勾配法を効果的に適用できるか?
  • RQ2実世界のログとHDマップから構築された微分可能でデータ駆動型のシミュレータは、都市ドライブのための効果的な閉ループポリシー学習を可能にするか?
  • RQ3本手法は、従来の行動コーディングや摂動ベースの手法と比較して、一般化性能およびロバストネスにおいて優れているか?
  • RQ4シミュレーション内でのみ学習されたポリシーが、未確認の都市シナリオにおいて実世界の自律走行車両を効果的に制御できるか、その範囲はどの程度か?
  • RQ5明示的な報酬形状設計を伴わず、アシスト学習と補助的目標(例:快適性、安全性)の両方を最適化できるか?

主な発見

  • 本手法は、シミュレーションにおいてすべてのベースラインを上回り、I1K(15 ± 7)およびL2(0.42 ± 0.00)の指標が最低となり、軌道の正確性が高く、衝突回数も少ないことが示された。
  • オフロード衝突は15 ± 7回、リア衝突は46 ± 5回であり、行動コーディング(79 ± 23および395 ± 170)およびBC-perturb(14 ± 4および73 ± 7)よりも顕著に低い。
  • モデルは、以前に確認されていなかったプライベートテストトラックにおいても良好に一般化し、赤信号で停止し、緑に変わると進行する信号付き交差点を正常に通過した。実世界でのデプロイで確認された。
  • 快適性の失敗は637K ± 41K回であり、BC-perturb(636K ± 22K)およびMS Prediction(595K ± 49K)よりも低く、動的相互作用の処理が改善されたことが示された。
  • シミュレーション内で学習されたポリシーは、7台のカメラ、3台のLiDAR、11台のレーダーを搭載した実世界のフォード・フェュージョン車両を効果的に制御でき、実世界での実現可能性が裏付けられた。
  • 複雑な状態の摂動やオンポリシーのデータ収集を不要としつつも、最先端の性能を達成しており、分布シフトに対してロバストであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。