Skip to main content
QUICK REVIEW

[論文レビュー] Driving Behavior Modeling using Naturalistic Human Driving Data with Inverse Reinforcement Learning

Zhiyu Huang, Jingda Wu|arXiv (Cornell University)|Oct 7, 2020
Autonomous Vehicle Technology and Safety参考文献 40被引用数 8
ひとこと要約

本稿では、離散的潜在的ドライブ意図に関する構造的仮定を導入した逆強化学習(IRL)を用いて、自然的ハイウェイデータ上で実行可能な最大エントロピーIRLを実現する、個人に合わせたドライブ行動モデリング手法を提案する。多項式サンプラーを用いて候補軌跡を生成し、相互作用に配慮した環境モデリングを統合することで、人間らしさと頑健性に優れた、ドライバー固有の解釈可能な報酬関数を学習する。この手法はNGSIMデータセットにおいて、一般モデルを著しく上回る性能を示す。

ABSTRACT

Driving behavior modeling is of great importance for designing safe, smart, and personalized autonomous driving systems. In this paper, an internal reward function-based driving model that emulates the human's decision-making mechanism is utilized. To infer the reward function parameters from naturalistic human driving data, we propose a structural assumption about human driving behavior that focuses on discrete latent driving intentions. It converts the continuous behavior modeling problem to a discrete setting and thus makes maximum entropy inverse reinforcement learning (IRL) tractable to learn reward functions. Specifically, a polynomial trajectory sampler is adopted to generate candidate trajectories considering high-level intentions and approximate the partition function in the maximum entropy IRL framework. An environment model considering interactive behaviors among the ego and surrounding vehicles is built to better estimate the generated trajectories. The proposed method is applied to learn personalized reward functions for individual human drivers from the NGSIM highway driving dataset. The qualitative results demonstrate that the learned reward functions are able to explicitly express the preferences of different drivers and interpret their decisions. The quantitative results reveal that the learned reward functions are robust, which is manifested by only a marginal decline in proximity to the human driving trajectories when applying the reward function in the testing conditions. For the testing performance, the personalized modeling method outperforms the general modeling approach, significantly reducing the modeling errors in human likeness (a custom metric to gauge accuracy), and these two methods deliver better results compared to other baseline methods.

研究の動機と目的

  • より安全で、個人に合わせた自律走行車の実現に向けて、ドライバーの個人差や意思決定メカニズムを捉えた人間のドライブ行動モデリングを目的とする。
  • 連続的かつ高次元のドライブ状態における最大エントロピーIRLの非可解性を、離散的潜在的ドライブ意図に関する構造的仮定を導入することで解決する。
  • 周囲の車両に及ぼされる速度低下などの相互作用効果を報酬関数推定に組み込むことで、軌跡予測の精度を向上させる。
  • 特にNGSIMハイウェイデータセットからの実世界の自然的ドライブデータから、解釈可能で頑健な報酬関数学習を可能にする。
  • 個人に合わせた報酬関数が、一般モデルやベースラインモデルと比較して、軌跡計画において優れた性能を示すことを実証すること。

提案手法

  • 人間ドライバーが離散的で高レベルの意図(例:レーン変更、レーン維持)に基づいて候補軌跡を生成すると仮定し、連続的制御問題を離散的かつ取り扱いやすいIRL設定に変換する。
  • 多項式軌跡サンプラーが、異なる戦術的意思決定と所望速度を反映する多様な候補軌跡を生成し、報酬評価の基盤を提供する。
  • 最大エントロピーIRLにおける分配関数を生成された軌跡を用いて近似することで、特徴量の期待値を効率的に計算可能にする。
  • 周囲の車両の反応、特にエゴ車両の操作に起因する速度低下を予測する環境モデルを導入し、軌跡評価をより現実的に行う。
  • 生成された軌跡からの期待特徴量と、人間ドライブデータで観測された特徴量を一致させることで、最大エントロピーIRLを用いて報酬関数を学習する。
  • 報酬関数に相互作用に配慮したダイナミクスを統合し、エゴ行動が周囲に与える影響が学習された好みに反映されるようにする。

実験結果

リサーチクエスチョン

  • RQ1離散的潜在的意図に関する構造的仮定を導入することで、連続的かつ高次元のドライブ行動モデリングに最大エントロピーIRLフレームワークを効果的に適用できるか?
  • RQ2特に周囲の車両に及ぼされる速度低下を含む相互作用に配慮した軌跡予測を組み込むことで、報酬関数推定の精度がどの程度向上するか?
  • RQ3個々のドライバーのデータから個人に合わせた報酬関数を学習することで、一般モデリング手法と比較して、モデリング性能がどの程度向上するか?
  • RQ4未知の条件下でテストした際、学習された報酬関数の頑健性はどの程度で、人間らしさの観点からベースラインモデルと比較してどうなるか?
  • RQ5予測モデルの精度が、学習された報酬関数を用いた個人に合わせた軌跡計画の性能に及ぼす影響は何か?

主な発見

  • 個人に合わせたモデリング手法は、一般モデリング手法と比較して人間らしさの観点でのモデリング誤差を顕著に低減し、人間のドライブ行動をより正確に再現することを示した。
  • 学習された報酬関数は頑健であり、テスト時に人間の軌跡に近づくほどわずかな低下しか示さず、優れた一般化能力を示した。
  • 特に周囲の車両に及ぼされる速度低下を反映する相互作用への配慮が、正確な報酬関数推定とモデリング性能の向上に不可欠であった。
  • 周囲の車両の反応行動をシミュレートしないと、学習結果はより良くなるが一般化性能が損なわれるため、フィッティングと頑健性のトレードオフが顕在化した。
  • 学習された報酬関数を用いた個人に合わせた計画の精度は、予測モデルの精度に強く依存するが、それでも一般報酬関数を用いた計画を上回る性能を示した。
  • 本手法は、IDM+MOBILおよび一定速度ベースラインモデルの両方を、軌跡類似度および人間らしさの指標において上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。