Skip to main content
QUICK REVIEW

[論文レビュー] Interpretable Modelling of Driving Behaviors in Interactive Driving Scenarios based on Cumulative Prospect Theory

Liting Sun, Wei Zhan|arXiv (Cornell University)|Jul 19, 2019
Autonomous Vehicle Technology and Safety参考文献 26被引用数 5
ひとこと要約

本稿では、実際のドライブデータから効用、価値、意思決定重み関数を推定する階層的学習アルゴリズムを用いて、インタラクティブな状況における人間の運転行動をCPTに基づく解釈可能なモデルとして提案する。このモデルは時間到着到達時間(TTC)モデルを上回り、ニューラルネットワークの性能と同等の結果を示しながらも、はるかに少ないデータで学習可能であり、損失回避や確率重み付けといった非合理的な行動を捉えている。

ABSTRACT

Understanding human driving behavior is important for autonomous vehicles. In this paper, we propose an interpretable human behavior model in interactive driving scenarios based on the cumulative prospect theory (CPT). As a non-expected utility theory, CPT can well explain some systematically biased or ``irrational'' behavior/decisions of human that cannot be explained by the expected utility theory. Hence, the goal of this work is to formulate the human drivers' behavior generation model with CPT so that some ``irrational'' behavior or decisions of human can be better captured and predicted. Towards such a goal, we first develop a CPT-driven decision-making model focusing on driving scenarios with two interacting agents. A hierarchical learning algorithm is proposed afterward to learn the utility function, the value function, and the decision weighting function in the CPT model. A case study for roundabout merging is also provided as verification. With real driving data, the prediction performances of three different models are compared: a predefined model based on time-to-collision (TTC), a learning-based model based on neural networks, and the proposed CPT-based model. The results show that the proposed model outperforms the TTC model and achieves similar performance as the learning-based model with much less training data and better interpretability.

研究の動機と目的

  • 合理的な意思決定に加え、体系的なバイアス(非合理的な)な運転意思決定を捉える解釈可能な人間行動モデルの開発を目的とする。
  • 期待効用理論(EUT)を超えた効用ベースのモデリングを、損失回避や確率重み付けといった行動バイアスを説明する累積的プロスペクティブ理論(CPT)を組み込むことで拡張することを目的とする。
  • 逆強化学習と非線形ロジスティック回帰を組み合わせた階層的学習フレームワークを用いて、データ効率的なドライバー行動モデルの学習を可能とすることを目的とする。
  • 実際のドライブデータ(円環合流シナリオ)を用いて、モデルの予測精度と解釈可能性を検証することを目的とする。

提案手法

  • 2エージェントのインタラクティブなドライブシナリオにおけるCPT駆動意思決定モデルを定式化し、期待効用を累積的プロスペクティブ理論(CPT)に置き換えることで、限界的合理的性をモデル化する。
  • 階層的学習アルゴリズムを開発:まず逆強化学習を用いて効用関数を推定し、次に非線形ロジスティック回帰を用いて価値関数および意思決定重み関数を学習する。
  • 時間到着到達時間(TTC)、時間到交差点到達時間(TTI)、および安全マージンに基づく効用関数を採用し、ドライバーの好みを表現する。
  • 2680フレーム(67対の軌道ペアから生成)の訓練/テストフレームを生成するために、移動ウィンドウスライシング戦略を採用する。
  • 非線形ロジスティック回帰を用いて意思決定重み関数を学習し、低確率イベントの過大評価と高確率イベントの低く評価する傾向を捉える。
  • 成功確率を主な指標として用い、予め定義されたTTCモデルおよびディープニューラルネットワーク(NN)ベースラインと比較して、モデルの性能を検証する。

実験結果

リサーチクエスチョン

  • RQ1累積的プロスペクティブ理論(CPT)は、損失回避や確率重み付けといった非合理的な運転行動を、インタラクティブな状況において効果的にモデル化できるか?
  • RQ2予測精度とデータ効率の観点から、CPTに基づくモデルは、事前に定義されたTTCモデルおよびデータを多く必要とするニューラルネットワークモデルと比べてどのように差がつくか?
  • RQ3CPTモデルのパラメータは、人間の意思決定バイアスの観点から、どの程度意味的に解釈可能か?
  • RQ4階層的学習アプローチは、実際のドライブデータから効用関数、価値関数、および意思決定重み関数を効果的に推定できるか?

主な発見

  • 提案されたCPTモデルは、実験2においてドライバーの軌道予測の成功率が95.45%を達成し、TTCモデル(81.82%)を上回り、ニューラルネットワークモデル(97%)と同等の性能を示した。
  • 実験1では、異なる軌道ペアへの一般化性能をテストしたが、CPTモデルはTTCモデルを著しく上回り、はるかに少ないデータでニューラルネットワークモデルと同等の性能を達成した。
  • 学習された意思決定重み関数は、低確率イベントの過大評価と高確率イベントの低く評価する傾向を示し、行動経済学における重要な行動バイアスをモデルが正しく捉えていることを確認した。
  • α* = 0.9827およびγ* = 0.6742といったモデルパラメータは、解釈可能であり、損失回避やリスク感受性といった既知の人間行動パターンと整合していた。
  • CPTモデルは高いデータ効率性を示した:67対の軌道ペアから得た2680フレームのデータのみで高い性能を達成したが、ニューラルネットワークモデルは効果的な一般化を実現するためにはより多くのデータを必要とした。
  • 階層的学習フレームワークは、逆強化学習と非線形ロジスティック回帰を組み合わせることで、実際のドライブデータからCPTモデルのすべての要素を効果的に学習できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。