Skip to main content
QUICK REVIEW

[논문 리뷰] DropoutDAgger: A Bayesian Approach to Safe Imitation Learning

Kunal Menda, Katherine Driggs-Campbell|arXiv (Cornell University)|2017. 09. 18.
Robot Manipulation and Learning참고 문헌 18인용 수 13
한 줄 요약

DropoutDAgger는 DAgger 비례 학습 알고리즘에 베이지안 확장 기법을 도입하여 신경망에서 드롭아웃을 사용해 초보자 정책의 행동에 대한 불확실성 추정을 수행함으로써 탐색과 이용의 균형을 이루는 확률적 안전 조치를 가능하게 한다. MuJoCo HalfCheetah 및 듀빈스 자동차 라이다 주행 작업에서 평가한 결과, 관측 노이즈가 높은 환경에서도 DAgger 변종 및 행동 복제보다 뛰어난 안전성과 학습 성능을 달성하였다.

ABSTRACT

While imitation learning is becoming common practice in robotics, this approach often suffers from data mismatch and compounding errors. DAgger is an iterative algorithm that addresses these issues by continually aggregating training data from both the expert and novice policies, but does not consider the impact of safety. We present a probabilistic extension to DAgger, which uses the distribution over actions provided by the novice policy, for a given observation. Our method, which we call DropoutDAgger, uses dropout to train the novice as a Bayesian neural network that provides insight to its confidence. Using the distribution over the novice's actions, we estimate a probabilistic measure of safety with respect to the expert action, tuned to balance exploration and exploitation. The utility of this approach is evaluated on the MuJoCo HalfCheetah and in a simple driving experiment, demonstrating improved performance and safety compared to other DAgger variants and classic imitation learning.

연구 동기 및 목표

  • 이민화 학습에서 분포 외 상태에 처했을 경우의 안전 보장을 확보하지 못하는 문제를 해결하기 위해.
  • 전문가의 시범 행동을 넘어서 안전한 탐색을 가능하게 하여 이민화 학습의 강인성을 향상시키기 위해.
  • 드롭아웃 정규화 정책에서 유도된 불확실성 추정을 활용해 행동 선택을 이끄는 확률적 프레임워크를 개발하기 위해.
  • 초보자 정책의 행동에 대한 자신감을 기반으로 탐색과 이용의 균형을 맞추어 전문가 개입에 대한 의존도를 줄이기 위해.

제안 방법

  • 추론 중 드롭아웃을 사용하여 베이지안 신경망으로서의 초보자 정책을 훈련하여 행동에 대한 분포를 확보한다.
  • 각 관측에 대해 초보자 정책의 행동 불확실성을 추정하여 안전 결정을 지원한다.
  • 초보자 정책의 예측 행동에 대한 신뢰도가 낮거나 불확실성이 높을 경우 전문가 행동을 선택하는 의사결정 규칙을 설계한다.
  • 전문가 행동과 초보자 행동의 차이를 초보자 정책의 신뢰도로 가중한 확률적 안전 조치를 기반으로 한다.
  • 초보자 정책의 행동 분포를 DAgger 프레임워크에 통합하여 반복적으로 정책의 강인성을 향상시키면서도 안전성을 유지한다.
  • 탐색과 안전성을 균형 잡기 위해 하이퍼파라미터 τ(안전 기준치), p(전문가 행동 확률), d(드롭아웃 비율)를 조정한다.

실험 결과

연구 질문

  • RQ1드롭아웃을 적용한 베이지안 신경망이 이민화 학습 정책의 신뢰할 수 있는 불확실성 추정을 제공할 수 있는가?
  • RQ2초보자 정책의 행동 불확실성은 학습 도중 어떤 식으로 확률적 안전 조치를 정의하는 데 활용될 수 있는가?
  • RQ3불확실성 기반 의사결정 규칙을 통합할 경우 기존 DAgger 및 행동 복제 대비 학습 성능과 안전성 향상이 이루어지는가?
  • RQ4드롭아웃 비율 및 안전 기준치와 같은 하이퍼파라미터의 변화에 대해 제안된 방법의 성능는 얼마나 민감한가?
  • RQ5비안전 인식 기반 기준 대비 학습 성능가 유사한 수준을 유지하면서도 완전한 안전성을 유지할 수 있는가?

주요 결과

  • DropoutDAgger는 모든 실험에서 완벽한 안전성 성능을 달성하였으며, 고도의 애러토르닉 불확실성 환경에서도 마찬가지였다.
  • 듀빈스 자동차 라이다 환경에서 DropoutDAgger는 행동 복제 및 SafeDAgger*보다 뛰어난 학습 성능를 보였고, 동시에 완전한 안전성을 유지하였다.
  • 높은 관측 노이즈에 대해서도 강인성을 입증하였으며, 라이다 측정값이 가우시안 노이즈에 의해 손상된 환경에서도 학습 성능이 유지되었다.
  • 온도 파rameter τ를 낮추거나 드롭아웃 비율 d를 높일수록 알고리즘이 더 보수적으로 작동하여 학습 성능이 행동 복제 수준으로 감소하였다.
  • 드롭아웃 확률을 0.05에서 0.1로 증가시킬 경우 τ 및 p에 대한 하이퍼파라미터 선택 민감도가 감소하여 강인성이 향상되었다.
  • 다양한 하이퍼파라미터 설정에서도 알고리즘이 우수한 성능를 유지하여 안정성과 실용적 사용 가능성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.