Skip to main content
QUICK REVIEW

[論文レビュー] Imitating Driver Behavior with Generative Adversarial Networks

Alex Kuefler, Jeremy Morton|arXiv (Cornell University)|Jan 24, 2017
Autonomous Vehicle Technology and Safety参考文献 29被引用数 5
ひとこと要約

本稿では、NDSIMデータセットからのエキスパート軌道を用いて敵対的報酬信号でポリシーを訓練することで、段階的誤差を低減し、現実的で安定した車線変更と制御を実現する、再帰的ニューラルネットワーク(GRU)を用いた生成的対抗的模倣学習(GAIL)フレームワークを提案する。この手法により、行動コーディングとルールベースモデルを凌駕する、耐障害性に富んだ長時間にわたるシミュレーションが可能になる。

ABSTRACT

The ability to accurately predict and simulate human driving behavior is critical for the development of intelligent transportation systems. Traditional modeling methods have employed simple parametric models and behavioral cloning. This paper adopts a method for overcoming the problem of cascading errors inherent in prior approaches, resulting in realistic behavior that is robust to trajectory perturbations. We extend Generative Adversarial Imitation Learning to the training of recurrent policies, and we demonstrate that our model outperforms rule-based controllers and maximum likelihood models in realistic highway simulations. Our model both reproduces emergent behavior of human drivers, such as lane change rate, while maintaining realistic control over long time horizons.

研究の動機と目的

  • 長時間にわたる運転シナリオにおいて、行動コーディングの段階的誤差が性能を低下させる問題に対処すること。
  • 手動で設計された報酬関数に依存せずに、エキスパート軌道から学習することで、長期的な運転シミュレーションの忠実度を向上させること。
  • 時間的依存性をよりよくモデル化できるよう、GAILを再帰的ポリシーに拡張すること。
  • 実際の高速道路シミュレーションにおいて、ルールベース制御器と最大尤度モデルと比較して、本モデルの性能を評価すること。
  • GAILに再帰的ネットワークを適用することで、車線変更頻度などの自己組織的行動を捉えつつ、安定性を維持できることを示すこと。

提案手法

  • 本手法は、識別器ネットワークを用いてエキスパートの行動とポリシーが生成する行動を区別できるようにし、ポリシーがエキスパートの行動と区別がつかないよう学習することで、生成的対抗的模倣学習(GAIL)を用いてポリシーを訓練する。
  • 時間的依存性をモデル化するために、再帰的ポリシー(GRU)を用い、前向きネットワークよりも長時間の行動をより良く再現する。
  • Raw LIDAR入力と手動で選択された道路特徴量を入力として、連続的な旋回速度と加速量を予測するポリシーを、エンド・ツー・エンドで訓練する。
  • 識別器はエキスパート行動とポリシーが生成する行動を区別するように学習し、ポリシーは識別器を欺くように更新される。このプロセスはミニマックスゲームを形成する。
  • トレーニングプロセスでは、NGSIMデータセットからのエキスパート軌道を用い、状態表現にはLIDAR距離と距離変化率を含める。
  • 報酬関数の手動設計を避けるために、識別器からの代替報酬を用いることで、事前の報酬モデリングなしに頑健な模倣が可能になる。

実験結果

リサーチクエスチョン

  • RQ1行動コーディングと比較して、再帰的ポリシーを用いたGAILは、長時間にわたる運転シミュレーションにおける段階的誤差を低減できるか?
  • RQ2GAILに再帰的ネットワークを適用することで、人間の運転行動の時間的ダイナミクスのモデリングが向上するか?
  • RQ3GAILベースのポリシーは、ルールベース制御器(例:IDM + MOBIL)と比較して、衝突率およびオフロード率の点で優れているか?
  • RQ4GAILポリシーは、車線変更頻度や滑らかなブレーキングといった、人間らしい自己組織的行動をどの程度再現できるか?
  • RQ5行動コーディングとは異なり、未知の状態や摂動に対して発散せずに一般化できるか?

主な発見

  • GAIL GRUポリシーは、すべてのモデルの中でオフロード時間と衝突率が最も低く、行動コーディングおよびルールベース制御器を上回った。
  • GAIL GRUポリシーは、車線変更頻度において、実際の人間の運転行動に最も近づき、IDM + MOBILを含む他のすべてのモデルを上回った。
  • GAIL GRUポリシーは、旋回速度とジャージャーのKLダイバージェンスが最小であったが、直線道路ではわずかな振動が見られた。
  • 行動コーディングモデルは段階的誤差に苦しんでおり、短期的な性能は優れていたが、オフロードおよび衝突率が高かった。
  • GRUベースのGAILモデルは、非再帰的GAILと比較して加速度の振動を低減したが、人間ドライバーほどは滑らかではなかった。
  • GAILベースのモデルは、エキスパートデータと比較して、車線変更頻度が1.5%以内に収まり、BCおよびSGモデルは顕著に性能が低かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。