Skip to main content
QUICK REVIEW

[論文レビュー] A deep inverse reinforcement learning approach to route choice modeling with context-dependent rewards

Zhan Zhao, Yuebing Liang|arXiv (Cornell University)|Jun 18, 2022
Transportation Planning and Optimization被引用数 8
ひとこと要約

本稿では、上海のタクシーGPSデータを用いたリンクベースのルート選択モデル化を目的として、敵対的逆強化学習(AIRL)を用いて文脈依存的で非線形な報酬関数を捉える深層逆強化学習(IRL)フレームワーク、RCM-AIRLを提案する。この手法は、予測精度と一般化性能に優れ、特に未学習の目的地に対する性能が顕著に向上し、従来のDCMおよび模倣学習ベースラインを上回る。

ABSTRACT

Route choice modeling is a fundamental task in transportation planning and demand forecasting. Classical methods generally adopt the discrete choice model (DCM) framework with linear utility functions and high-level route characteristics. While several recent studies have started to explore the applicability of deep learning for route choice modeling, they are limited to path-based models with relatively simple model architectures and relying on predefined choice sets. Existing link-based models can capture the dynamic nature of link choices within the trip without the need for choice set generation, but still assume linear relationships and link-additive features. To address these issues, this study proposes a general deep inverse reinforcement learning (IRL) framework for link-based route choice modeling, which is capable of incorporating diverse features (of the state, action and trip context) and capturing complex relationships. Specifically, we adapt an adversarial IRL model to the route choice problem for efficient estimation of context-dependent reward functions without value iteration. Experiment results based on taxi GPS data from Shanghai, China validate the superior prediction performance of the proposed model over conventional DCMs and other imitation learning baselines, even for destinations unseen in the training data. Further analysis show that the model exhibits competitive computational efficiency and reasonable interpretability. The proposed methodology provides a new direction for future development of route choice models. It is general and can be adaptable to other route choice problems across different modes and networks.

研究の動機と目的

  • 都市ネットワークにおける複雑で非線形的かつ文脈依存的なルート選好を捉えることが難しい古典的離散選択モデル(DCMs)の限界を克服すること。
  • 事前に定義された選択集合を必要とせず、多様で高次元の特徴(状態、行動、文脈)を統合可能な柔軟なリンクベースのルート選択モデルを構築すること。
  • 価値反復を用いずに、文脈依存的報酬関数を効率的にモデルフリーで推定することにより、計算効率と解釈可能性を向上させること。
  • 実世界の軌跡データ上でモデルの性能を検証し、ネットワーク変更に対する対応的分析(counterfactual analysis)の能力を示すこと。
  • 現在のタクシー軌跡への応用を超えて、異なる輸送モードやネットワークタイプに適応可能な汎用的フレームワークを提供すること。

提案手法

  • 状態、行動、および文脈に依存する報酬関数を持つマルコフ決定過程(MDP)としてルート選択問題を定式化する。
  • 価値反復を回避するモデルフリーな方法で、人間の軌跡から報酬関数を推定するために敵対的逆強化学習(AIRL)を適応応用する。
  • 深層ニューラルネットワーク(DNNs)を用いて報酬関数および方策関数をパラメータ化し、非線形的かつ高次元の特徴統合を可能にする。
  • 目的地までの距離、移動目的、時刻などの文脈特徴を組み込み、動的で状況に応じたルート選好をモデル化する。
  • 各ノードにおける実際の出次数リンクのみを許容する有効な行動空間制約を導入し、妥当なルートのみを予測することを保証する。
  • ディスクラミネーターが専門家軌跡と生成された軌跡を区別するAIRLフレームワークにおいて、示された軌跡を用いてモデルをエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1線形的な効用関数に依存せずに、複雑で文脈依存的なルート選択行動を効果的にモデル化できるか、深層逆強化学習フレームワークが有効であるか。
  • RQ2未学習の目的地に対して、提案されたRCM-AIRLモデルは従来のDCMおよび他の模倣学習ベースラインと比較して、どの程度優れたルート選択予測性能を示すか。
  • RQ3目的地関連の文脈特徴が、目標指向の行動学習およびルートループの回避能力にどの程度影響を与えるか。
  • RQ4再トレーニングを伴わず、更新されたネットワーク特徴を単に再計算することで、リンク閉鎖などの対応的シナリオに一般化できるか。
  • RQ5従来のディープラーニングおよび伝統的なDCMベースの手法と比較して、提案モデルの解釈可能性と計算効率はどの程度高いか。

主な発見

  • RCM-AIRLは、従来のDCMおよび他の模倣学習ベースラインよりも顕著に優れた予測性能を示し、テストデータにおいてED(0.228)、BLEUスコア(0.717)、JSD(0.351)、LP(-4.301)を達成した。
  • 未学習の目的地に対しても良好な一般化性能を維持しており、学習データに含まれないODペアでテストしても高い性能を発揮した。
  • 目的地関連の文脈特徴を除外すると、性能が著しく低下(ED: 0.829、BLEU: 0.262、JSD: 0.593、LP: -9.018)、軌跡が頻繁にループに陥ることが確認された。
  • 計算効率は競争力があり、解釈可能性についても妥当な水準であり、SHAP解析により目的地までの距離が最も影響力の高い特徴であることが示された。
  • 対応的分析では、RCM-AIRLがネットワーク変更(例:リンク閉鎖)に伴う行動変化を、再トレーニングを伴わず、更新されたネットワーク特徴を再計算するだけで予測可能であった。
  • 目標指向の探索学習が、目的地の文脈特徴に強く依存しており、報酬関数が効率的に目的地点に収束する方向に導かれることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。