Skip to main content
QUICK REVIEW

[논문 리뷰] Locally Weighted Regression Pseudo-Rehearsal for Online Learning of Vehicle Dynamics

Grady Williams, Brian Goldfain|arXiv (Cornell University)|2019. 05. 13.
Domain Adaptation and Few-Shot Learning참고 문헌 25인용 수 9
한 줄 요약

이 논문은 차량 동역학 모델링에서 치명적인 잊음 현상을 방지하기 위해 증분적 LWPR와 신경망 적응을 결합한 새로운 온라인 학습 방법인 국소 가중 투영 회귀 가짜 재훈련(LW-PR²)을 제안한다. 온라인으로 업데이트되는 LWPR 모델로부터 가짜 샘플을 생성함으로써, 비정상적인 입력 및 목표 분포 조건에서도 안정적이고 실시간으로 신경망 컨트롤러를 적응시킬 수 있으며, 시뮬레이션 및 실제 자율주행 테스트 모두에서 오차 증가를 최소화하면서 뛰어난 성능을 달성한다.

ABSTRACT

We consider the problem of online adaptation of a neural network designed to represent vehicle dynamics. The neural network model is intended to be used by an MPC control law to autonomously control the vehicle. This problem is challenging because both the input and target distributions are non-stationary, and naive approaches to online adaptation result in catastrophic forgetting, which can in turn lead to controller failures. We present a novel online learning method, which combines the pseudo-rehearsal method with locally weighted projection regression. We demonstrate the effectiveness of the resulting Locally Weighted Projection Regression Pseudo-Rehearsal (LW-PR$^2$) method in simulation and on a large real world dataset collected with a 1/5 scale autonomous vehicle.

연구 동기 및 목표

  • 비정상적인 입력 및 목표 분포 조건 하에서 차량 동역학 모델링을 위한 온라인 신경망 적응에서 치명적인 잊음 현상을 해결하기 위해.
  • 자율주행 차량의 모델 예측 제어(MPC)에 사용되는 신경망 모델의 실시간이고 안정적인 적응을 가능하게 하는 방법을 개발하기 위해.
  • 상태와 동역학이 시간이 지남에 따라 변화하는 동적 환경에서 표준 SGD와 단순 재훈련 방법의 한계를 극복하기 위해.
  • 환경 및 기계적 조건이 변화하는 현실적인 장기 주행 시나리오에서 방법의 유효성을 검증하기 위해.

제안 방법

  • MPC를 위한 신경망 모델과 온라인으로 업데이트되는 증분적 LWPR 모델을 유지하여 정규화를 위한 가짜 샘플을 생성한다.
  • 가짜 샘플은 무작위 또는 대표적인 입력을 현재의 LWPR 모델에 통과시켜 현재 동역학을 반영하는 합성 목표 출력을 생성함으로써 생성된다.
  • 신규 데이터와 가짜 샘플 간의 균형을 유지하는 제약된 기울기 업데이트를 통해 신경망을 훈련시며, 시스템 식별 데이터셋에서의 발산을 방지한다.
  • LWPR 모델은 실시간으로 증분적으로 업데이트되어 목표 분포의 변화, 예를 들어 도로 마찰 계수나 배터리 상태의 변화에 적응한다.
  • 제약된 최적화 기법을 통해 파라미터 업데이트를 제한하여 새로운 데이터에 과적합되는 것을 방지함으로써 이전에 학습한 동역학을 손상시키지 않는다.
  • 과거 데이터를 저장하지 않으면서도 안전하고 지속적인 온라인 학습이 가능하므로, 실시간 MPC 응용에 적합하다.

실험 결과

연구 질문

  • RQ1입력 및 목표 분포가 비정상적인 조건에서 온라인 차량 동역학 학습에 가짜 재훈련을 효과적으로 적용할 수 있는가?
  • RQ2장기적인 자율주행 운영 중 신경망 기반 차량 동역학 모델에서 치명적인 잊음 현상을 어떻게 완화할 수 있는가?
  • RQ3증분적으로 업데이트되는 LWPR 모델이 고품질의 가짜 샘플을 생성하여 온라인 신경망 적응을 안정화시킬 수 있는가?
  • RQ4제안된 방법이 타이어 마모, 다양한 도로 조건, 배터리 상태 변화와 같은 동적 변화 하에서도 신뢰할 수 있는 MPC 제어를 가능하게 하는가?
  • RQ5실제 자율주행 시나리오에서 LW-PR²의 성능은 표준 SGD 및 기준 재훈련 방법보다 어떻게 비교되는가?

주요 결과

  • 장기적인 자율주행 현장 테스트에서 LW-PR²는 전일 데이터셋에서 총 MSE 2.11을 기록하여 기초 모델(MSE: 3.18)을 크게 능가했으며, 오프라인 LWPR 기준선 수준의 성능을 달성했다.
  • 실시간 자율주행 동안의 활성 성능은 MSE 2.54를 기록하여 최대 시속 50km까지의 실제 주행 조건에서도 안정적인 제어를 보였다.
  • 4.5시간 동안 비가 온 후 마른 노면, 배터리 상태 변화 등 다양한 조건에서 차량이 운행되더라도 LW-PR²는 치명적인 잊음 현상을 효과적으로 방지했다.
  • SGD는 고립된 검증 세트에서는 유사한 성능를 보였지만, MPC 환경에서는 불안정성으로 인해 성능이 저하되는 반면, LW-PR²는 이를 우수하게 보완했다.
  • 제약된 기울기 업데이트 덕분에, 상태 공간의 고오차 영역에 노출되어도 모델이 원래 시스템 식별 데이터에서 벗어나지 않았다.
  • 증분적 LWPR를 활용한 가짜 샘플링은 타이어 마모 및 마찰 계수 변화와 같은 동적 변화에 효과적으로 적응시켰으며, 장기간 운영 중에도 제어기 신뢰성을 유지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.