Skip to main content
QUICK REVIEW

[논문 리뷰] Decomposition of Uncertainty for Active Learning and Reliable Reinforcement Learning in Stochastic Systems.

Stefan Depeweg, José Miguel Hernández-Lobato|arXiv (Cornell University)|2017. 10. 19.
Machine Learning and Algorithms참고 문헌 16인용 수 22
한 줄 요약

이 논문은 잠재변수를 가진 베이지안 신경망에서 예측 불확실성을 경험적(모델) 및 난류적(데이터) 성분으로 분해하는 방법을 제안한다. 이 분해를 활성 학습과 강화 학습에 활용함으로써 불확실성 캘리브레이션과 의사결정 신뢰도를 향상시키며, 불확실성 인식 기반 활성 학습과 강력한 강화 학습 정책에서 향상된 성능을 보여준다.

ABSTRACT

Bayesian neural networks (BNNs) with latent variables are probabilistic models which can automatically identify complex stochastic patterns in the data. We study in these models a decomposition of predictive uncertainty into its epistemic and aleatoric components. We show how such a decomposition arises naturally in a Bayesian active learning scenario and develop a new objective for reliable reinforcement learning (RL) with an epistemic and aleatoric risk element. Our experiments illustrate the usefulness of the resulting decomposition in active learning and reliable RL.

연구 동기 및 목표

  • 잠재변수를 가진 베이지안 신경망에서 예측 불확실성을 경험적(모델) 및 난류적(데이터) 성분으로 분해하는 것.
  • 불확실성 분해를 활용해 정보성 높은 데이터 샘플을 우선순위 정렬함으로써 더 신뢰할 수 있는 활성 학습을 가능하게 하는 것.
  • 경험적 및 난류적 불확실성을 명시적으로 고려하는 리스크 인식 강화 학습 목표 함수를 개발하는 것.
  • 불확실성 분해를 강화 학습 훈련에 통합함으로써 확률적 환경에서 정책의 신뢰도를 향상시키는 것.
  • 불확실성 분해의 실용성을 활성 학습 및 신뢰할 수 있는 강화 학습 설정에서 실증적으로 검증하는 것.

제안 방법

  • 복잡한 확률적 패턴을 데이터에서 모델링하기 위해 잠재변수를 가진 베이지안 신경망을 사용한다.
  • 네트워크 가중치와 잠재변수에 대한 사후 분포를 근사하기 위해 변분 추론을 적용한다.
  • 전체 분산의 법칙을 활용하여 예측 분산의 경험적 및 난류적 성분으로의 분해를 유도한다.
  • 기대 수익과 경험적 및 난류적 리스크 항목을 조합한 새로운 강화 학습 목표 함수를 도입한다.
  • 높은 경험적 불확실성의 샘플을 선택하여 레이블링을 유도함으로써 불확실성 추정치를 활용해 활성 학습을 이끌어낸다.
  • 불확실성 캘리브레이션과 정책 신뢰도를 평가하기 위해 확률적 환경에서 모델을 훈련하고 평가한다.

실험 결과

연구 질문

  • RQ1잠재변수가 존재하는 상황에서 베이지안 신경망의 예측 불확실성은 어떻게 경험적 및 난류적 성분으로 체계적으로 분해될 수 있는가?
  • RQ2불확실성 분해는 어떤 정도로 활성 학습 시나리오에서 샘플 효율성을 향상시키는가?
  • RQ3경험적 및 난류적 불확실성의 명시적 모델링은 강화 학습에서 정책의 신뢰도를 향상시키는 데 기여하는가?
  • RQ4제안된 리스크 인식 강화 학습 목표 함수는 분포 이탈에 대한 강건성 측면에서 기존 강화 학습 기준 모델보다 어떻게 비교되는가?
  • RQ5불확실성 분해는 확률적 환경에서 불확실성 캘리브레이션과 의사결정에 어떤 영향을 미치는가?

주요 결과

  • 예측 불확실성의 경험적 및 난류적 성분으로의 분해는 베이지안 활성 학습에서 자연스럽게 발생하며, 더 정보성 높은 데이터 선택을 가능하게 한다.
  • 제안된 불확실성 분해는 경험적 불확실성이 높은 인스턴스를 우선순위로 삼음으로써 활성 학습에서 샘플 효율성을 향상시킨다.
  • 두 가지 유형의 불확실성을 통합한 리스크 인식 강화 학습 목표 함수는 확률적 환경에서 더 강력한 정책을 도출한다.
  • 이 방법은 분포 이탈 상황에서 예측의 과신을 줄이며 불확실성 캘리브레이션을 향상시킴을 보여준다.
  • 실증 결과는 불확실성 분해를 사용한 모델이 활성 학습 및 강화 학습 벤치마크에서 더 우수한 일반화 능력과 신뢰도를 달성함을 보여준다.
  • 이 방법은 경험적 불확실성(지식 부족으로 인한 것)과 데이터 노이즈(본질적 잡음)로 인한 불확실성 간의 구분을 가능하게 하여 강화 학습에서 신뢰할 수 있는 탐색을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.