Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Network Based Model Predictive Control for an Autonomous Vehicle

Maria Luiza Costa Vianna, Éric Goubault|arXiv (Cornell University)|2021. 07. 30.
Advanced Control Systems Optimization참고 문헌 20인용 수 4
한 줄 요약

이 논문은 자율주행차에서 계산 비용이 높은 모델 예측 제어(MPC)를 대체하기 위해 지도학습과 강화학습을 통해 작고 효율적인 신경망을 훈련시키는 방법을 제안한다. 자전거 모델을 사용하여, 시그모이드 활성화 함수를 사용하는 얕은 3층 신경망이 1cm 이내의 추적 오차를 달성함으로써 강화학습을 능가하고 실시간 구동 및 공식적 검증이 가능함을 입증한다.

ABSTRACT

We study learning based controllers as a replacement for model predictive controllers (MPC) for the control of autonomous vehicles. We concentrate for the experiments on the simple yet representative bicycle model. We compare training by supervised learning and by reinforcement learning. We also discuss the neural net architectures so as to obtain small nets with the best performances. This work aims at producing controllers that can both be embedded on real-time platforms and amenable to verification by formal methods techniques.

연구 동기 및 목표

  • 자율주행차에서 높은 복잡도를 가지는 MPC 제어기를 경량 신경망 제어기로 대체한다.
  • 지도학습과 강화학습이 실시간 구동을 위해 가능한 정확도로 MPC 행동을 근사할 수 있는지 조사한다.
  • 신경망 아키텍처를 최적화하여 크기와 계산 비용을 최소화하면서도 높은 제어 정밀도를 유지한다.
  • 결과로 도출된 신경망 제어기가 안전이 중요한 응용 분야에서 공식적 검증이 가능하도록 보장한다.
  • 간단한 훈련 궤적에서 유래한 데이터를 사용해 복잡하고 새로운 궤적에서의 일반화 성능을 평가한다.

제안 방법

  • MPC 제어기에서 생성한 상태-행동 쌍을 사용하여 피드포워드 신경망을 지도학습으로 훈련한다.
  • 입력으로는 유한한 시간 간격(20단계) 내의 향후 기준점 포함 차량-궤적 상대 상태를 사용한다.
  • 깊이(1–3층), 너비(10–100개 뉴런), 활성화 함수(ReLU, tanh, 시그모이드)를 다양하게 변화시켜 다양한 네트워크 아키텍처로 훈련한다.
  • 환경 상호작용을 통해 직접 MPC 정책을 학습하기 위해 액터-크리틱 프레임워크를 사용한 강화학습을 적용한다.
  • 검증 궤적에서 추적 오차의 평균, 최대값, 표준편차를 사용해 성능를 비교한다.
  • 공식적 검증에 유리한 네트워크 설계 원칙을 적용하여 안전 검증을 위한 작은 단순한 아키텍처를 우선시한다.

실험 결과

연구 질문

  • RQ1지난학습을 통해 훈련된 작은 신경망이 자율주행차 궤적 추적을 위한 MPC 제어기의 행동을 정확하게 재현할 수 있는가?
  • RQ2깊이, 너비, 활성화 함수와 같은 아키텍처 선택이 신경망 제어기의 성능 및 효율성에 어떤 영향을 미치는가?
  • RQ3시스템 동역학이 알려져 있을 때 강화학습이 지도학습과 비교해 유사한 정확도의 제어기를 생성할 수 있는가?
  • RQ4간단한 궤적(예: 직선)에서 훈련된 네트워크가 복잡한 실제 궤적으로 일반화되는 데 효과적인가?
  • RQ5입력 표현 방식(예: 전체 향후 궤적 대비 상대 상태)이 학습 성능과 일반화에 어떤 영향을 미치는가?

주요 결과

  • 은닉층에서 시그모이드 활성화 함수를 사용하고 1층당 10개 뉴런을 가지는 3층 신경망이 평균 오차 0.059cm와 표준편차 0.03cm를 기록하여 ReLU 및 tanh보다 우수한 성능을 보였다.
  • 지도학습은 최대 추적 오차 0.39cm를 기록하여 강화학습의 0.97cm보다 유의미하게 낮아 정밀도가 뛰어나다는 것을 보여주었다.
  • 간단한 궤적(예: 직선)에서 훈련된 네트워크가 복잡한 궤적으로 효과적으로 일반화되었으며, 검증 데이터에서 평균 오차는 0.077cm였다.
  • 층수를 늘리면 뉴런 수를 늘리는 것보다 계산 비용이 더 크게 증가하여 이 문제에 있어서 더 깊은 네트워크는 효율성이 떨어졌다.
  • 강화학습은 만족스러운 성능를 달성하기 위해 훨씬 큰 네트워크(400, 300 뉴런)를 필요로 했으며, 단계당 평가 시간이 0.11ms였고, 최고의 지도학습 네트워크의 6μs보다 훨씬 길었다.
  • 최종 신경망 제어기는 MPC 궤적에서 1cm 이내의 최대 편차를 기록하여 강력한 근사 능력과 실시간 구동에 적합함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.