Skip to main content
QUICK REVIEW

[논문 리뷰] Imitating Driver Behavior with Generative Adversarial Networks

Alex Kuefler, Jeremy Morton|arXiv (Cornell University)|2017. 01. 24.
Autonomous Vehicle Technology and Safety참고 문헌 29인용 수 5
한 줄 요약

이 논문은 인간 고속도로 주행 행동을 모델링하기 위해 순환 신경망(GRUs)을 사용하는 생성적 적대적 모방학습(GAIL) 프레임워크를 제안한다. 이는 행동 복제와 규칙 기반 모델을 능가하는 안정적이고 장기적인 시뮬레이션을 가능하게 한다. NGSIM 데이터셋의 전문가 트레이젝터리를 악성 보상 신호를 사용해 모방하는 정책을 훈련시킴으로써, 누적 오차를 감소시키고 현실적인 차선 변경, 제어 안정성 및 낮은 이탈/충돌 비율을 달성한다.

ABSTRACT

The ability to accurately predict and simulate human driving behavior is critical for the development of intelligent transportation systems. Traditional modeling methods have employed simple parametric models and behavioral cloning. This paper adopts a method for overcoming the problem of cascading errors inherent in prior approaches, resulting in realistic behavior that is robust to trajectory perturbations. We extend Generative Adversarial Imitation Learning to the training of recurrent policies, and we demonstrate that our model outperforms rule-based controllers and maximum likelihood models in realistic highway simulations. Our model both reproduces emergent behavior of human drivers, such as lane change rate, while maintaining realistic control over long time horizons.

연구 동기 및 목표

  • 장기 주행 시뮬레이션에서 행동 복제의 누적 오차 문제를 해결하기 위해.
  • 수동으로 설정된 보상 함수에 의존하지 않고 전문가 트레이젝터리에서 학습함으로써 장기 주행 시뮬레이션의 정밀도를 향상시키기 위해.
  • 더 나은 시간적 모델링을 위해 GAIL을 순환 정책으로 확장하기 위해.
  • 실제 고속도로 시뮬레이션에서 규칙 기반 제어기와 최대 우도 모델에 비해 모델 성능을 평가하기 위해.
  • GAIL과 순환 네트워크가 잠재적인 인간 유사 행동(예: 차선 변경 빈도)을 포착하면서도 안정성을 유지함을 보여주기 위해.

제안 방법

  • 이 방법은 생성적 적대적 모방학습(GAIL)을 사용하여, 판별기 네트워크를 통해 전문가 행동과 동일시할 수 있는 행동을 생성하는 정책 네트워크를 훈련시킨다.
  • 시간적 의존성을 모델링하기 위해 순환 정책 네트워크(GRU)를 사용하여 피드포워드 네트워크보다 장기 시뮬레이션 성능을 향상시킨다.
  • 정책은 원시 LIDAR 입력과 수작업으로 선택한 도로 특징을 사용하여 연속적인 조향 속도 및 가속도 행동을 예측하기 위해 엔드 투 엔드로 훈련된다.
  • 판별기는 전문가 행동과 정책에 의해 생성된 행동를 구분하도록 훈련되며, 정책는 판별기를 속이도록 업데이트되어 최소 최대 게임을 형성한다.
  • 훈련 과정은 NGSIM 데이터셋의 전문가 트레이젝터리를 사용하며, 상태 표현에는 LIDAR 거리와 범위 속도가 포함된다.
  • 전체 보상 모델링이 필요로 하지 않는 보상 함수를 사용함으로써, 사전 보상 모델링 없이도 강력한 모방 학습이 가능하도록 한다.

실험 결과

연구 질문

  • RQ1행동 복제에 비해 GAIL과 순환 정책를 사용할 경우 장기 주행 시뮬레이션에서 누적 오차를 줄일 수 있는가?
  • RQ2GAIL에 순환 네트워크를 사용할 경우 인간 주행 행동의 시간적 동역학을 향상시킬 수 있는가?
  • RQ3GAIL 기반 정책는 규칙 기반 제어기(IDM + MOBIL 등)에 비해 충돌률과 이탈률에서 어떻게 성능을 내는가?
  • RQ4GAIL 정책는 차선 변경 빈도와 부드러운 브레이킹과 같은 인간 유사 행동을 어느 정도 재현하는가?
  • RQ5행동 복제와 달리, GAIL 모델은 예측 불가능한 상태나 외부 요동에 대해 발산하지 않고 일반화할 수 있는가?

주요 결과

  • GAIL GRU 정책는 모든 모델 중에서 가장 낮은 이탈 시간과 충돌률을 기록했으며, 행동 복제 및 규칙 기반 제어기보다 뛰어난 성능을 보였다.
  • GAIL GRU 정책는 차선 변경 빈도에서 실제 인간 주행 행동과 가장 유사했으며, IDM + MOBIL를 포함한 모든 다른 모델보다 뛰어났다.
  • GAIL GRU 정책는 조향 속도와 급격한 가속도의 KL 발산이 가장 낮았지만, 직선 도로에서 조향 속도에 약간의 진동이 있었다.
  • 행동 복제 모델은 누적 오차로 인해 짧은 시뮬레이션에서는 우수한 성능를 보였지만, 장기 시뮬레이션에서는 이탈 및 충돌 비율이 높았다.
  • GRU 기반 GAIL 모델은 비순환 GAIL에 비해 가속도 진동을 줄였지만, 여전히 인간 운전자보다 더 많은 진동을 보였다.
  • GAIL 기반 모델은 전문가 데이터의 1.5% 이내의 차선 변경 빈도를 달성했으며, BC 및 SG 모델은 상당히 뒤처졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.