Skip to main content
QUICK REVIEW

[논문 리뷰] Driving Behavior Modeling using Naturalistic Human Driving Data with Inverse Reinforcement Learning

Zhiyu Huang, Jingda Wu|arXiv (Cornell University)|2020. 10. 07.
Autonomous Vehicle Technology and Safety참고 문헌 40인용 수 8
한 줄 요약

이 논문은 자연주의적 고속도로 데이터에서 이산 잠재 주행 의도에 대한 구조적 가정을 도입한 역강화학습(IRL)을 사용하여 개인화된 주행 행동 모델링 방법을 제안한다. 이는 최대 엔트로피 IRL을 타당하게 적용할 수 있도록 한다. 다항식 샘플러를 통해 후보 경로를 생성하고 상호작용 인지 환경 모델링을 통합함으로써, 인간과 유사하고 해석 가능한, 운전자별로 특화된 보상 함수를 학습한다. 이는 NGSIM 데이터셋에서 일반 모델 대비 인간과 유사성과 강건성 면에서 뛰어난 성능을 보인다.

ABSTRACT

Driving behavior modeling is of great importance for designing safe, smart, and personalized autonomous driving systems. In this paper, an internal reward function-based driving model that emulates the human's decision-making mechanism is utilized. To infer the reward function parameters from naturalistic human driving data, we propose a structural assumption about human driving behavior that focuses on discrete latent driving intentions. It converts the continuous behavior modeling problem to a discrete setting and thus makes maximum entropy inverse reinforcement learning (IRL) tractable to learn reward functions. Specifically, a polynomial trajectory sampler is adopted to generate candidate trajectories considering high-level intentions and approximate the partition function in the maximum entropy IRL framework. An environment model considering interactive behaviors among the ego and surrounding vehicles is built to better estimate the generated trajectories. The proposed method is applied to learn personalized reward functions for individual human drivers from the NGSIM highway driving dataset. The qualitative results demonstrate that the learned reward functions are able to explicitly express the preferences of different drivers and interpret their decisions. The quantitative results reveal that the learned reward functions are robust, which is manifested by only a marginal decline in proximity to the human driving trajectories when applying the reward function in the testing conditions. For the testing performance, the personalized modeling method outperforms the general modeling approach, significantly reducing the modeling errors in human likeness (a custom metric to gauge accuracy), and these two methods deliver better results compared to other baseline methods.

연구 동기 및 목표

  • 안전하고 더 개인화된 자율주행 차량을 위해, 개인의 선호와 의사결정 메커니즘을 반영하는 인간 주행 행동 모델링을 목적으로 한다.
  • 연속적이고 고차원적인 주행 상태에서 최대 엔트로피 IRL의 비가역성 문제를 해결하기 위해 이산 잠재 주행 의도에 대한 구조적 가정을 도입한다.
  • 주변 차량에 미치는 영향, 예를 들어 속도 감소와 같은 상호작용 효과를 보상 함수 추정에 통합함으로써 궤적 예측 정확도를 향상시킨다.
  • 특히 NGSIM 고속도로 데이터셋에서 실세계 자연주의 주행 데이터로부터 해석 가능하고 강건한 보상 함수 학습을 가능하게 한다.
  • 개인화된 보상 함수가 일반 모델이나 기준 모델 대비 궤적 계획 성능에서 더 뛰어나다는 것을 입증한다.

제안 방법

  • 인간 운전자는 이산적 고수준 의도(예: 차선 변경, 차선 유지)를 기반으로 후보 경로를 생성하며, 이는 연속적 제어 문제를 이산적이고 해석 가능한 IRL 설정으로 변환한다.
  • 다항식 경로 샘플러는 다양한 전술적 결정과 목표 속도를 반영하는 다양한 후보 경로를 생성하여 보상 평가의 기초를 제공한다.
  • 최대 엔트로피 IRL의 분할 함수는 생성된 경로를 사용해 근사하여 기능 기대치의 효율적 계산을 가능하게 한다.
  • 환경 모델은 주변 차량의 반응, 특히 자동차의 조작로 인한 속도 감소까지 예측하여 궤적 결과를 더 현실적으로 평가한다.
  • 생성된 경로의 기대 기능 수를 인간 주행 데이터에서 관측된 기능 수와 일치시키는 방식으로 최대 엔트로피 IRL을 통해 보상 함수를 학습한다.
  • 자신의 행동이 주변 차량에 미치는 영향을 반영하기 위해 상호작용 인지 역학을 보상 함수에 통합함으로써, 학습된 선호도에 영향을 반영한다.

실험 결과

연구 질문

  • RQ1이산 잠재 의도에 대한 구조적 가정을 도입함으로써, 연속적이고 고차원적인 주행 행동 모델링에 최대 엔트로피 IRL 프레임워크를 효과적으로 적용할 수 있는가?
  • RQ2특히 주변 차량의 속도 감소를 포함한 상호작용 인지 궤적 예측을 통합할 경우, 보상 함수 추정의 정확도는 어떻게 향상되는가?
  • RQ3개별 운전자 데이터로부터 개인화된 보상 함수 학습이 일반 모델링 접근법에 비해 모델링 성능을 얼마나 향상시키는가?
  • RQ4시험 중에 예상치 못한 조건에서 학습된 보상 함수는 얼마나 강건한가? 인간과의 유사성 면에서 기준 모델과 비교해 볼 때 어떻게 되는가?
  • RQ5예측 정확도가 개인화된 궤적 계획 성능에 미치는 영향은 어떠한가?

주요 결과

  • 일반 모델링 접근법에 비해 개인화된 모델링 방법은 인간과의 유사성 면에서 모델링 오차를 크게 감소시켜 인간 주행 행동을 더 정확하게 재현함을 입증한다.
  • 학습된 보상 함수는 강건하며, 테스트 중에도 인간 궤적과의 유사도가 다소 감소할 뿐이지, 강력한 일반화 능력을 보여준다.
  • 특히 주변 차량에 미치는 속도 감소를 포함한 상호작용 인지 기능을 통합하는 것이 정확한 보상 함수 추정과 모델링 성능 향상에 결정적인 역할을 하였다.
  • 주변 차량의 반응 행동을 시뮬레이션하지 않으면 학습 결과는 더 나아졌지만 일반화 능력이 떨어져, 적합성과 강건성 사이의 상충 관계를 드러냈다.
  • 학습된 보상 함수를 사용한 개인화된 계획의 정확도는 예측 모델의 정확도에 크게 의존하지만, 여전히 일반 보상 함수를 사용한 계획보다 뛰어난 성능을 보였다.
  • IDM+MOBIL 및 일정 속도 기준 모델 모두보다 궤적 유사성 및 인간과의 유사성 지표 면에서 본 방법이 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.