Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Bayesian Reward Learning from Preferences

Daniel S. Brown, Scott Niekum|arXiv (Cornell University)|2019. 12. 10.
Reinforcement Learning in Robotics참고 문헌 43인용 수 15
한 줄 요약

이 논문은 보상 불확실성에 대해 추론할 수 있도록 고차원적 시각적 제어 작업에 스케일링 가능한 베이지안 인버스 강화학습 방법인 베이지안 리워드 외삽(B-REX)을 제안한다. 이는 보상 함수의 사후 분포에서 효율적으로 샘플링하기 위해 시퀀스 기반 특징과 선수자기 특징을 활용하며, MDP를 반복적으로 해결할 필요 없이 시연에 대한 선호도 레이블을 사용한다. B-REX는 암시적 정책의 높은 신뢰도 성능 경계를 제공하며, 최신의 점추정 방법과 경쟁 가능한 성능을 보이고, 최악의 경우 위험 분석을 통해 리워드 해킹을 탐지할 수 있다.

ABSTRACT

Bayesian inverse reinforcement learning (IRL) methods are ideal for safe imitation learning, as they allow a learning agent to reason about reward uncertainty and the safety of a learned policy. However, Bayesian IRL is computationally intractable for high-dimensional problems because each sample from the posterior requires solving an entire Markov Decision Process (MDP). While there exist non-Bayesian deep IRL methods, these methods typically infer point estimates of reward functions, precluding rigorous safety and uncertainty analysis. We propose Bayesian Reward Extrapolation (B-REX), a highly efficient, preference-based Bayesian reward learning algorithm that scales to high-dimensional, visual control tasks. Our approach uses successor feature representations and preferences over demonstrations to efficiently generate samples from the posterior distribution over the demonstrator's reward function without requiring an MDP solver. Using samples from the posterior, we demonstrate how to calculate high-confidence bounds on policy performance in the imitation learning setting, in which the ground-truth reward function is unknown. We evaluate our proposed approach on the task of learning to play Atari games via imitation learning from pixel inputs, with no access to the game score. We demonstrate that B-REX learns imitation policies that are competitive with a state-of-the-art deep imitation learning method that only learns a point estimate of the reward function. Furthermore, we demonstrate that samples from the posterior generated via B-REX can be used to compute high-confidence performance bounds for a variety of evaluation policies. We show that high-confidence performance bounds are useful for accurately ranking different evaluation policies when the reward function is unknown. We also demonstrate that high-confidence performance bounds may be useful for detecting reward hacking.

연구 동기 및 목표

  • 보상 불확실성에 대해 추론함으로써 고차원적 시각적 제어 작업에서 안전하고 강력한 암시 학습을 가능하게 하기 위해.
  • 기존의 베이지안 IRL이 내부 루프에서 반복적으로 MDP를 해결해야 하는 계산상의 비현실성을 해결하기 위해.
  • 원시 픽셀 입력과 선호도 기반 시연를 사용하는 복잡한 작업에 스케일링 가능한 딥 베이지안 IRL 방법을 개발하기 위해.
  • 진정한 보상이 알려져 있지 않은 상황에서 암시 정책의 이완 정책 평가를 높은 신뢰도로 가능하게 하기 위해.
  • 사후 샘플을 사용해 확률적 최악의 성능 경계를 계산함으로써 리워드 해킹을 탐지하기 위해.

제안 방법

  • B-REX는 MDP를 해결할 필요 없이, 시연에 대한 쌍별 선호도 레이블을 사용해 신경망을 훈련시켜 보상 함수를 예측한다.
  • 선속성 특징 표현을 활용해 향후 상태 방문의 기대값을 모델링함으로써, 효율적인 가치 함수 일반화를 가능하게 한다.
  • 쌍별 선호도 순위 기반의 우도를 사용한 변분 추론 프레임워크를 통해 보상 함수의 사후 분포에서 샘플링한다.
  • 사후 샘플을 사용해 높은 신뢰도 성능 경계를 계산하며, 예를 들어 보상 사후 분포에서 정책 수익의 5번째 백분위수(0.05-VaR)를 계산한다.
  • 소비자용 랩탑에서도 분당 수만 개의 사후 샘플을 생성할 수 있어 확장 가능한 불확실성 정량화를 가능하게 한다.
  • 이 방법은 기능 근사에 딥 신경망을 활용하며, 아케이트 게임의 원시 시각 관측값에서 끝에서 끝까지 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1고차원적 시각적 제어 작업에 대해 베이지안 인버스 강화학습을 계산적으로 실현 가능하게 만들 수 있는가?
  • RQ2베이지안 IRL에서 전체 MDP 해결을 대체할 수 있는 시연에 대한 선호도 기반 감독이 가능한가?
  • RQ3진정한 보상이 알려져 있지 않은 상황에서 딥 베이지안 IRL 방법의 사후 샘플이 높은 신뢰도의 이완 정책 평가를 가능하게 하는가?
  • RQ4사후 분포에서 유도된 최악의 성능 경계는 암시 학습에서 리워드 해킹을 탐지할 수 있는가?
  • RQ5B-REX는 보상 함수의 점추정치를 사용하는 최신의 딥 암시 학습 방법과 비교해 얼마나 잘 성능을 내는가?

주요 결과

  • B-REX는 소비자용 랩탑에서 분당 수만 개의 사후 보상 샘플을 생성할 수 있어 고차원 설정에서 확장 가능한 베이지안 추론을 가능하게 한다.
  • B-REX를 통해 학습된 암시 정책는 보상 함수의 점추정치만을 사용하는 최신의 딥 암시 학습 방법과 경쟁 가능한 성능을 보인다.
  • B-REX의 사후 분포에서 유도된 0.05-VaR(5번째 백분위수) 성능 경계는 정책 순위를 정확히 매기며, 예를 들어 보상이 희박한 상황에서 보상을 악용하는 'No-Op 정책'과 같은 고위험 행동을 식별할 수 있다.
  • 부분적으로 훈련된 정책의 진정한 보상 수익은 사후 평균 보상과 0.05-VaR 모두와 높은 상관관계를 보이며, 이는 경계의 신뢰성과 타당성을 검증한다.
  • 공격하지 않는 'No-Op 정책'(Breakout에서 공을 놓지 않는 정책)는 사후 분포 하에서 기대 수익이 높지만, 0.05-VaR는 매우 낮은 -134.9로 나타나 높은 위험성과 잠재적 리워드 해킹을 시사한다.
  • 사후 분포는 의도와 관련된 허구적 특징에 과적합된 정책을 탐지하는 데에도 사용될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.