Skip to main content
QUICK REVIEW

[논문 리뷰] Reward Uncertainty for Exploration in Preference-based Reinforcement Learning

Xinran Liang, Katherine Lin Shu|arXiv (Cornell University)|2022. 05. 24.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

이 논문은 선호 기반 강화 학습에서 탐색을 유도하기 위해 학습된 보상 모델 앙상블의 불확실성에 기반한 내재적 탐색 보너스인 RUNE(Reward Uncertainty for Exploration)를 제안한다. 보상 모델 간의 불일치를 피드백 불확실성의 대체 지표로 측정함으로써, RUNE는 MetaWorld 로봇 조작 작업에서 표본 효율성과 피드백 효율성을 모두 향상시키며, 상태 방문 빈도의 신뢰성에 의존하는 최신 기법들을 능가한다.

ABSTRACT

Conveying complex objectives to reinforcement learning (RL) agents often requires meticulous reward engineering. Preference-based RL methods are able to learn a more flexible reward model based on human preferences by actively incorporating human feedback, i.e. teacher's preferences between two clips of behaviors. However, poor feedback-efficiency still remains a problem in current preference-based RL algorithms, as tailored human feedback is very expensive. To handle this issue, previous methods have mainly focused on improving query selection and policy initialization. At the same time, recent exploration methods have proven to be a recipe for improving sample-efficiency in RL. We present an exploration method specifically for preference-based RL algorithms. Our main idea is to design an intrinsic reward by measuring the novelty based on learned reward. Specifically, we utilize disagreement across ensemble of learned reward models. Our intuition is that disagreement in learned reward model reflects uncertainty in tailored human feedback and could be useful for exploration. Our experiments show that exploration bonus from uncertainty in learned reward improves both feedback- and sample-efficiency of preference-based RL algorithms on complex robot manipulation tasks from MetaWorld benchmarks, compared with other existing exploration methods that measure the novelty of state visitation.

연구 동기 및 목표

  • 인간 피드백이 비용이 많이 들고 제한적인 선호 기반 강화 학습에서 피드백 효율성과 표본 효율성을 향상시키기 위해.
  • 기존 강화 학습에서 성공을 거둔 바에도 불구하고 선호 기반 RL에 특화된 탐색 방법의 부족을 해결하기 위해.
  • 인간 선호로부터 유도된 학습된 보상 함수의 불확실성이 탐색을 위한 의미 있는 내재적 보상으로 기능할 수 있는지 조사하기 위해.
  • 보상 예측의 불확실성을 활용하여 탐색을 인간의 선호와 일치시키는 방법을 개발하기 위해.

제안 방법

  • RUNE는 인간 선호 피드백을 기반으로 훈련된 보상 모델 앙상블을 사용하여 보상 예측의 불확실성을 추정한다.
  • 내재적 탐색 보너스는 앙상블의 예측 보상에 대한 표준편차로 계산된다.
  • 이 불확실성 신호는 인간 피드백의 모호성을 반영하며, 피드백이 덜 확실한 영역으로 탐색을 유도한다.
  • 학습을 위한 총 보상은 외부 환경 보상, 앙상블 예측의 평균, 그리고 내재적 불확실성 보너스를 조합하여 구성된다.
  • 이 방법은 기존의 선호 기반 RL 알고리즘과 호환되며, 보상 모델 앙상블 훈련 외에는 아키텍처 변경이 필요하지 않다.
  • 탐색은 상태 방문 빈도가 아닌 보상 불확실성에 의해 유도되며, 이는 인간의 선호와의 일치를 보장한다.

실험 결과

연구 질문

  • RQ1학습된 보상 함수의 불확실성은 선호 기반 RL에서 탐색을 위한 효과적인 내재적 보상으로 기능할 수 있는가?
  • RQ2보상 불확실성을 사용할 경우, 선호 기반 RL에서 최신 기법 대비 피드백 효율성과 표본 효율성이 향상되는가?
  • RQ3다양한 인간 피드백 쿼리 수와 앙상블 크기에 대해 제안된 방법의 탄력성은 어떠한가?
  • RQ4보상 불확실성에 기반한 내재적 보너스는 진정한 보상 함수로의 수렴을 더 빠르게 이끌어내는가?
  • RQ5낮은 피드백 예산 조건에서도 성능을 유지할 수 있는가? 이는 인간 입력이 제한된 실세계 응용에 적합한가?

주요 결과

  • RUNE는 MetaWorld 작업에서 표본 효율성을 향상시켜, PEBBLE 및 기타 기준 기법 대비 더 적은 환경 상호작용으로도 높은 성공률을 달성한다.
  • 피드백 예산이 80% 감소한 상황에서도 RUNE는 우수한 성능을 유지하지만, PEBBLE 기준 기법은 점점 더 높은 성공률에 도달하지 못한다.
  • RUNE에서 학습된 보상 함수는 EPIC 거리 측정 기준으로 진정한 보상에 더 빨리 수렴하고 더 가까이 도달함으로써 보다 우수한 보상 일치를 보인다.
  • 3, 5, 7의 다양한 앙상블 크기에 대해 안정적인 성능과 표본 효율성 저하 없이 유사한 성능을 유지하며, 탄력성이 뛰어나다.
  • 보상 불확실성에 기반한 내재적 보너스는 인간 선호와 일치하는 더 효과적인 탐색을 이끌어내며, 빠른 정책 학습과 향상된 피드백 효율성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.