Skip to main content
QUICK REVIEW

[논문 리뷰] A deep inverse reinforcement learning approach to route choice modeling with context-dependent rewards

Zhan Zhao, Yuebing Liang|arXiv (Cornell University)|2022. 06. 18.
Transportation Planning and Optimization인용 수 8
한 줄 요약

이 논문은 상하이 택시 GPS 데이터를 활용하여 링크 기반 경로 선택 모델링을 위한 딥 인버스 강화학습(IRR) 프레임워크인 RCM-AIRL을 제안한다. 이는 적대적 IRL을 통해 비선형이고 맥락에 따라 달라지는 보상 함수를 포착하여 예측 정확도와 일반화 능력을 향상시키며, 특히 미리보지 않은 목적지에 대해서도 뛰어난 성능을 발휘한다. 기존의 DCM 및 이민학습 기반 기준선보다 뛰어난 성능을 보인다.

ABSTRACT

Route choice modeling is a fundamental task in transportation planning and demand forecasting. Classical methods generally adopt the discrete choice model (DCM) framework with linear utility functions and high-level route characteristics. While several recent studies have started to explore the applicability of deep learning for route choice modeling, they are limited to path-based models with relatively simple model architectures and relying on predefined choice sets. Existing link-based models can capture the dynamic nature of link choices within the trip without the need for choice set generation, but still assume linear relationships and link-additive features. To address these issues, this study proposes a general deep inverse reinforcement learning (IRL) framework for link-based route choice modeling, which is capable of incorporating diverse features (of the state, action and trip context) and capturing complex relationships. Specifically, we adapt an adversarial IRL model to the route choice problem for efficient estimation of context-dependent reward functions without value iteration. Experiment results based on taxi GPS data from Shanghai, China validate the superior prediction performance of the proposed model over conventional DCMs and other imitation learning baselines, even for destinations unseen in the training data. Further analysis show that the model exhibits competitive computational efficiency and reasonable interpretability. The proposed methodology provides a new direction for future development of route choice models. It is general and can be adaptable to other route choice problems across different modes and networks.

연구 동기 및 목표

  • 도시 네트워크에서 복잡하고 비선형적이며 맥락에 따라 달라지는 경로 선택 선호도를 포착하는 데에 한계가 있는 전통적인 이산 선택 모델(DCM)의 문제점을 해결하기 위해.
  • 사전 정의된 선택 집합이 필요로 하지 않으며 다양한 고차원 특징(상태, 행동, 맥락)을 통합할 수 있는 융통성 있는 링크 기반 경로 선택 모델을 개발하기 위해.
  • 가치 반복을 통한 추정이 필요 없이 모델에 종속되지 않은 방식으로 맥락에 따라 달라지는 보상 함수를 효율적으로 추정함으로써 계산 효율성과 해석 가능성 향상을 위해.
  • 실세계 궤적 데이터를 기반으로 모델 성능을 검증하고 네트워크 변화 상황에서의 반사적 분석 능력을 입증하기 위해.
  • 현재 택시 궤적에 적용된 것 외에도 다양한 교통 수단과 네트워크 유형에 적용 가능한 일반화 가능한 프레임워크를 제공하기 위해.

제안 방법

  • 상태, 행동, 맥락에 따라 달라지는 보상 함수를 갖는 마르코프 결정 과정(MDP)으로 경로 선택 문제를 수식화한다.
  • 값 반복을 피하기 위해 모델에 종속되지 않은 방식으로 관찰된 인간의 궤적에서 보상 함수를 추정하기 위해 적대적 인버스 강화학습(AIRL)을 응용한다.
  • 딥 네ural 네트워크(DNN)를 사용하여 보상 함수와 정책 함수를 매개변수화함으로써 비선형적이고 고차원적인 특징 통합을 가능하게 한다.
  • 목적지까지의 거리, 여정 목적, 시간대와 같은 맥락 특징을 통합하여 동적이고 상황에 따라 달라지는 경로 선택 선호도를 모델링한다.
  • 모든 노드에서 존재하는 출구 링크에만 제한된 유효한 행동 공간 제약 조건을 구현하여 예측된 경로가 항상 타당한 경로가 되도록 보장한다.
  • 디스크림네이터가 전문가 궤적과 생성된 궤적을 구분하는 AIRL 프레임워크에서, 시연된 궤적을 사용해 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1선형 유틸리티 함수에 의존하지 않고도 깊이 있는 인버스 강화학습 프레임워크가 복잡하고 맥락에 따라 달라지는 경로 선택 행동을 효과적으로 모델링할 수 있는가?
  • RQ2제안된 RCM-AIRL 모델은 기존의 DCM 및 다른 이민학습 기반 기준선 대비, 특히 미리보지 않은 목적지에 대해서는 어떻게 성능을 발휘하는가?
  • RQ3목적지 관련 맥락 특징이 모델이 목표 지향적 행동을 학습하고 경로 루프를 피하는 데 얼마나 기여하는가?
  • RQ4재학습 없이도 네트워크 기능을 갱신하기만 하면, 예를 들어 링크 폐쇄와 같은 반사적 시나리오에 일반화할 수 있는가?
  • RQ5기존의 딥 러닝 및 전통적인 DCM 기반 접근법 대비 제안된 모델은 얼마나 해석 가능하고 계산 효율적인가?

주요 결과

  • RCM-AIRL는 기존의 DCM 및 다른 이민학습 기반 기준선보다 유의미하게 뛰어난 예측 성능을 보이며, 테스트 데이터에서 0.228 ED(Euclidean Distance), 0.717 BLEU 점수, 0.351 JSD, -4.301 LP(log-likelihood)를 기록한다.
  • 모델은 미리보지 않은 목적지에 대해 잘 일반화되며, 훈련 데이터에 포함되지 않은 OD 쌍에 대해서도 강력한 성능을 유지한다.
  • 목적지 관련 맥락 특징을 제외할 경우 성능이 급격히 저하되며(ED: 0.829, BLEU: 0.262, JSD: 0.593, LP: -9.018), 궤적이 자주 루프에 갇히는 경향이 있다.
  • 모델는 경쟁적인 계산 효율성과 합리적인 해석 가능성을 보이며, SHAP 분석 결과 목적지까지의 거리가 가장 영향력 있는 특징임을 확인했다.
  • 반사적 분석 결과, RCM-AIRL는 네트워크를 갱신한 후 기능을 재계산하기만 하면 재학습 없이도 네트워크 변경 상황(예: 링크 폐쇄)에서의 행동 변화를 예측할 수 있다.
  • 모델이 목표 지향적 탐색을 학습하는 능력은 목적지 맥락 특징에 의해 결정적으로 영향을 받으며, 이는 보상 함수가 목표지점으로의 효율적 수렴을 유도한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.