Skip to main content
QUICK REVIEW

[논문 리뷰] Safe end-to-end imitation learning for model predictive control

Keuntaek Lee, Kamil Saigol|arXiv (Cornell University)|2018. 03. 27.
Reinforcement Learning in Robotics참고 문헌 17인용 수 18
한 줄 요약

이 논문은 예측 불확실성 추정을 위해 베이지안 컨volution 신경망을 사용하고, 불확실성이 학습된 임계값을 초과할 경우 전문가 개입을 유도하는 안전한 엔드 투 엔드 복제 학습 프레임워크를 제안한다. 강화 학습과 복제 학습을 결합함으로써 수동 조정 없이 최적의 불확실성 임계값을 자동으로 학습할 수 있으며, 이는 새로운 또는 분포 외 테스트 입력 하에서 시각 기반 제어에서 강건한 성능을 보여준다. 이는 카트폴 및 자율 주행 시뮬레이션을 통해 검증되었다.

ABSTRACT

We propose the use of Bayesian networks, which provide both a mean value and an uncertainty estimate as output, to enhance the safety of learned control policies under circumstances in which a test-time input differs significantly from the training set. Our algorithm combines reinforcement learning and end-to-end imitation learning to simultaneously learn a control policy as well as a threshold over the predictive uncertainty of the learned model, with no hand-tuning required. Corrective action, such as a return of control to the model predictive controller or human expert, is taken when the uncertainty threshold is exceeded. We validate our method on fully-observable and vision-based partially-observable systems using cart-pole and autonomous driving simulations using deep convolutional Bayesian neural networks. We demonstrate that our method is robust to uncertainty resulting from varying system dynamics as well as from partial state observability.

연구 동기 및 목표

  • 로봇 제어에서 엔드 투 엔드 복제 학습의 안전성 한계를 해결하기 위해, 특히 새로운 또는 분포 외 테스트 입력 상황에서의 성능을 향상시키기 위해.
  • 자율 시스템이 예측의 불확실성을 감지하고 수동 조정 없이 교정 조치를 시행할 수 있도록 하기 위해.
  • 강화 학습과 복제 학습을 결합하여 제어 정책과 안전한 의사결정을 위한 최적의 불확실성 임계값을 동시에 학습하기 위해.
  • 실제 환경의 요동(예: 새로운 장애물)이 있는 상황에서 완전 관측 및 부분 관측(시각 기반) 제어 작업에 프레임워크를 검증하기 위해.
  • 베이지안 딥 네트워크에서 도출된 예측 불확실성이 고속 자율 시스템에서 안전한 제어 이행을 위한 신뢰할 수 있는 신호가 될 수 있음을 입증하기 위해.

제안 방법

  • 몬테 카를로 드롭아웃을 사용한 베이지안 컨볼루션 신경망(Bayesian DNNs)을 활용하여 평균 제어 동작과 예측 불확실성 추정치를 동시에 출력한다.
  • 예측 불확실성이 임계값을 초과할 경우 모델 예측 제어기(MPC)로 전환하도록 최적의 불확실성 임계값을 학습하기 위해 강화 학습(RL) 구성 요소를 사용한다.
  • 복제 학습(다운그레이드 스타일의 데이터 수집 방식)과 강화 학습을 융합하여 배치 학습 환경에서 정책과 임계값을 동시에 학습한다.
  • 상태 정보에 접근할 수 없는 원시 이미지 관측치를 사용하여 시각 기반 제어에 프레임워크를 적용함으로써 부분 관측 제어를 가능하게 한다.
  • 누적 보상과 성공률을 최대화하기 위해 교차 엔트로피 방법(CEM)을 사용해 불확실성 임계값을 최적화한다.
  • 베이지안 네트워크의 예측 분산이 학습된 임계값을 초과할 경우 전문가 MPC로 제어를 이관하는 안전 메커니즘을 도입한다.

실험 결과

연구 질문

  • RQ1베이지안 딥 네트워크에서 유도된 예측 불확실성은 새로운 테스트 입력에서 시각 기반 제어 정책이 실패할 가능성이 높을 때를 신뢰성 있게 나타낼 수 있는가?
  • RQ2강화 학습 에이전트가 수동 조정 없이 최적의 불확실성 임계값을 자동으로 학습할 수 있는가?
  • RQ3제안된 방법은 부분 관측 및 새로운 환경적 요동 상황에서 시각 기반 MPC 작업에서 어떻게 성능을 발휘하는가?
  • RQ4베이지안 불확실성 추정의 통합이 고속 자율 제어 작업의 강건성과 안전성에 기여하는가?
  • RQ5이 프레임워크는 새로운 장애물이 있는 자율 주행과 같은 복잡한 실제 세계 유사 시나리오로 일반화될 수 있는가?

주요 결과

  • 수동 조정 없이도 강화 학습을 통해 최적의 임계값이 자연스럽게 유도되어 작업 성능과 안전성을 극대화하는 데 성공했다.
  • 카트폴 스윙업 작업에서, 다양한 불확실성 임계값 하에서도 높은 성공률과 안정된 성능을 기록했으며, 최적의 임계값은 CEM 최적화를 통해 도출되었다.
  • 자율 주행 시뮬레이션에서, 새로운 장애물이 나타날 경우 베이지안 네트워크의 예측 분산이 크게 증가하여 MPC 전문가로의 제어 이행이 적절하게 유도되었다.
  • 시스템은 새로운 물체 유형과 색상 변형에 대해 강건성을 보였지만, 일부 경우에서 색상에 민감한 반응을 보여, 향후 추가 연구가 필요함을 시사했다.
  • 부분 관측 조건에서도 높은 총 보상과 성공률 유지로 인해, 이 프레임워크가 시각 기반 제어에서 효과적임을 확인했다.
  • 베이지안 불확실성을 안전 신호로 사용함으로써 실패 탐지와 전문가 제어 이행이 신뢰성 있게 이루어졌으며, 분포 이탈 상황에서의 시스템 신뢰도가 크게 향상되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.