Skip to main content
QUICK REVIEW

[논문 리뷰] Bayesian Controller Fusion: Leveraging Control Priors in Deep Reinforcement Learning for Robotics

Krishan Rana, Vibhavari Dasagi|arXiv (Cornell University)|2021. 07. 21.
Fault Detection and Control Systems인용 수 7
한 줄 요약

이 논문은 로봇 공학에서 안전하고 샘플 효율적인 학습을 가능하게 하기 위해 딥 강화학습 정책과 수동으로 설계된 제어기의 불확실성 인식 출력을 융합하는 베이지안 제어기 융합(BCF)을 제안한다. 베이지안 추론을 통해 이러한 제어기를 융합함으로써 BCF는 훈련 속도를 가속화하고, 탐색 및 도달 작업에서 각각 116% 및 282%의 성능 향상을 달성하면서도 분포 외 상태에서 안전한 행동을 보장한다.

ABSTRACT

We present Bayesian Controller Fusion (BCF): a hybrid control strategy that combines the strengths of traditional hand-crafted controllers and model-free deep reinforcement learning (RL). BCF thrives in the robotics domain, where reliable but suboptimal control priors exist for many tasks, but RL from scratch remains unsafe and data-inefficient. By fusing uncertainty-aware distributional outputs from each system, BCF arbitrates control between them, exploiting their respective strengths. We study BCF on two real-world robotics tasks involving navigation in a vast and long-horizon environment, and a complex reaching task that involves manipulability maximisation. For both these domains, simple handcrafted controllers exist that can solve the task at hand in a risk-averse manner but do not necessarily exhibit the optimal solution given limitations in analytical modelling, controller miscalibration and task variation. As exploration is naturally guided by the prior in the early stages of training, BCF accelerates learning, while substantially improving beyond the performance of the control prior, as the policy gains more experience. More importantly, given the risk-aversity of the control prior, BCF ensures safe exploration and deployment, where the control prior naturally dominates the action distribution in states unknown to the policy. We additionally show BCF's applicability to the zero-shot sim-to-real setting and its ability to deal with out-of-distribution states in the real world. BCF is a promising approach towards combining the complementary strengths of deep RL and traditional robotic control, surpassing what either can achieve independently. The code and supplementary video material are made publicly available at https://krishanrana.github.io/bcf.

연구 동기 및 목표

  • 실세계 로봇 공학에서 딥 강화학습의 샘플 비효율성과 안전성 한계를 해결한다.
  • 기존에 존재하는 신뢰성은 있으나 최적화되지 않은 수동으로 설계된 제어기를 행동 사전으로 활용하여 탐색을 안내하고 샘플 효율성을 향상시킨다.
  • 알 수 없는 또는 분포 외 상태에서 고전적 제어기의 위험 회피 성향을 활용하여 안전한 구현을 보장한다.
  • 불확실성 인식 고전적 제어기를 융합함으로써 딥 강화학습 정책의 신뢰성 있는 시뮬레이션에서 실제 환경으로의 전이를 가능하게 한다.
  • 신뢰도에 기반해 학습된 제어기와 고전적 제어기를 동적으로 조율하는 하이브리드 제어 전략을 개발하여, 사전보다 높은 최종 정책 성능을 달성한다.

제안 방법

  • 딥 강화학습 정책과 수동으로 설계된 제어기의 확률적 동작 분포를 융합하는 베이지안 융합 메커니즘을 수립하며, 예측 불확실성을 사용해 기여도를 가중한다.
  • 각 액추에이터에 대해 제어기의 출력을 단변량 가우시안 분포로 표현하며, 불확실성 추정치에서 유도된 평균과 분산을 사용한다.
  • 베이지안 모델 평균화를 적용하여 복합 동작 분포를 계산하며, 각 상태에서 불확실성이 낮은 제어기가 지배한다.
  • 초기 훈련 단계에서 강건성과 다양성을 향상시키기 위해 딥 강화학습 정책의 앙상블을 사용해 경험적 불확실성을 추정한다.
  • 융합 메커니즘을 조합형 정책에 통합하여 실세계 환경에서의 안전한 탐색과 안정적 구현을 가능하게 한다.
  • 장기적인 수평 탐색 및 조작 능력 최적화 도약 작업에 이 프레임워크를 적용하여 성능 향상과 분포 이탈에 대한 강건성을 입증한다.

실험 결과

연구 질문

  • RQ1불확실성 인식 딥 강화학습 정책과 수동으로 설계된 제어기를 융합하면, 로봇 제어 작업에서 샘플 효율성과 최종 성능 향상에 기여할 수 있는가?
  • RQ2강화학습 정책이 분포 외 상태를 만났을 때 하이브리드 제어 전략은 어떻게 안전한 탐색과 구현을 보장할 수 있는가?
  • RQ3제어 사전과 학습된 정책의 베이지안 융합은 복잡한 로봇 작업에서 신뢰할 수 있는 시뮬레이션-실세계 전이를 어느 정도 가능하게 하는가?
  • RQ4융합 메커니즘은 사전이 최적화되지 않은 경우에도 최종 정책이 사전 성능을 초월할 수 있는가?
  • RQ5제어기 간의 불확실성 기반 조율이 장기적인 수평, 보상이 희박한 환경에서 학습 동역학과 강건성에 어떤 영향을 미치는가?

주요 결과

  • BCF는 장기적인 수평 탐색 작업에서 제어 사전 대비 116% 향상된 성능을 달성하여 기준선 방법들을 크게 앞서며 성능 향상을 입증했다.
  • 복잡한 도약 작업에서 BCF는 기준선 제어기 대비 조작 능력을 34.9% 향상시켜 과제 특화 최적화에서 뛰어난 성능을 보였다.
  • 실세계 탐색 실행에서 BCF는 반복적 행동이 흔한 반응형 제어기에서 흔들림을 제거함으로써 작동 시간을 50.7% 감소시켰다.
  • BCF는 두 작업 모두에서 성공적인 시뮬레이션-실세계 전이를 달성했으며, 단독 강화학습 정책이 실패한 분포 외 상태에서도 정책이 일반화됨을 입증했다.
  • 앙상블 기반 불확실성 추정을 사용함으로써 알려진 영역에서는 낮은 초기 불확실성과 탐색되지 않은 영역에서는 높은 분산을 기록하여 효과적인 탐색이 가능했다.
  • BCF의 베이지안 융합 메커니즘은 알 수 없는 상태에서 위험 회피 성향을 가진 제어 사전이 지배함으로써 구현 중 안전한 행동을 보장했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.