Skip to main content
QUICK REVIEW

[논문 리뷰] PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training

Kimin Lee, Laura Smith|arXiv (Cornell University)|2021. 06. 09.
Reinforcement Learning in Robotics참고 문헌 76인용 수 13
한 줄 요약

PEBBLE는 경험 재라벨링를 통해 비순차적 학습과 비순차적 학습을 결합한 피드백 효율적인 인터랙티브 강화학습 프레임워크를 제안한다. 이는 인간 피드백과 샘플 요구량을 줄이는 데 기여한다. 인간 피드백이 업데이트될 때마다 과거 경험을 재라벨링하고, 에이전트를 다양한 행동을 탐색하도록 사전 훈련함으로써, 희소 보상에서 지도 학습 기반 강화학습과 유사한 성능을 달성한다. 이로 인해 복잡한 운동 및 조작 작업을 최소한의 인간 선호 피드백으로 수행할 수 있다.

ABSTRACT

Conveying complex objectives to reinforcement learning (RL) agents can often be difficult, involving meticulous design of reward functions that are sufficiently informative yet easy enough to provide. Human-in-the-loop RL methods allow practitioners to instead interactively teach agents through tailored feedback; however, such approaches have been challenging to scale since human feedback is very expensive. In this work, we aim to make this process more sample- and feedback-efficient. We present an off-policy, interactive RL algorithm that capitalizes on the strengths of both feedback and off-policy learning. Specifically, we learn a reward model by actively querying a teacher's preferences between two clips of behavior and use it to train an agent. To enable off-policy learning, we relabel all the agent's past experience when its reward model changes. We additionally show that pre-training our agents with unsupervised exploration substantially increases the mileage of its queries. We demonstrate that our approach is capable of learning tasks of higher complexity than previously considered by human-in-the-loop methods, including a variety of locomotion and robotic manipulation skills. We also show that our method is able to utilize real-time human feedback to effectively prevent reward exploitation and learn new behaviors that are difficult to specify with standard reward functions.

연구 동기 및 목표

  • 인터랙티브 강화학습에서 인간 피드백의 높은 비용을 줄이기 위해 피드백 및 샘플 효율성을 향상시키는 것.
  • 로봇의 복잡한 행동—예를 들어 운동 및 조작—을 인간 선호 비교의 소수의 수단으로 학습할 수 있도록 하는 것.
  • 인간이 개입하여 의도하지 않은 행동을 수정할 수 있도록 보상 오용을 완화하는 것.
  • 비순차적 학습과 비순차적 학습을 조합하여 수집된 경험의 재사용을 극대화하고 실시간 인간 입력에 대한 의존도를 줄이는 것.

제안 방법

  • 에이전트는 내재적 호기심을 사용하여 비순차적 사전 훈련을 통해 다양한 상태를 탐색하고 일관되고 다양한 행동을 생성한다.
  • 이중 선호 피드백 형태로 인간 피드백을 수집하며, 이는 보상 모델을 훈련하는 데 사용된다. 두 개의 에이전트 행동 클립 간의 선호를 평가한다.
  • 보상 모델이 업데이트될 때마다 모든 과거 경험을 업데이트된 보상 모델로 재라벨링함으로써 비순차적 학습을 가능하게 하고 데이터 효율성을 극대화한다.
  • 학습된 보상 모델 하에 기대 수익을 최대화하는 방식으로 비순차적 강화학습(예: SAC)을 사용해 정책을 업데이트한다.
  • 정보성 있는 행동 클립을 선택하기 위해 불확실성 기반 샘플링(불일치 또는 엔트로피)을 사용하여 학습 효율성을 향상시킨다.
  • 이 방법은 MuJoCo의 연속 제어 작업—Walker, Cheetah, Quadruped, Hopper, CartPole—에 적용되었으며, 실제 인간 피드백을 사용하였다.

실험 결과

연구 질문

  • RQ1비순차적 사전 훈련이 인터랙티브 강화학습에서 인간 피드백의 품질과 정보성에 기여하는가?
  • RQ2경험 재라벨링를 통한 비순차적 학습이 인간 피드백 쿼리의 수를 크게 줄일 수 있는가?
  • RQ3PEBBLE는 엔지니어링된 보상 함수로는 명시하기 어려운 복잡한 로봇 행동—예를 들어 백플립 또는 다리 흔들기—을 학습할 수 있는가?
  • RQ4PEBBLE는 표준 강화학습에 비해 보상 오용을 효과적으로 방지하고, 더 자연스럽고 인간 같은 행동을 유도하는가?

주요 결과

  • Quadruped-walk 및 Hopper-backflip를 포함한 모든 작업에서, PEBBLE는 지정된 희소 보상 기반 SAC와 유사한 성능을 달성했으며, 피드백 쿼리 수는 1400개에 불과했다.
  • Quadruped-walk 작업에서, 동일한 피드백 쿼리 수로 Preference PPO보다 PEBBLE가 더 뛰어난 피드백 효율성을 보였다.
  • 더 긴 행동 클립(예: 10단계 세그먼트)에 대한 인간 피드백은 단계별 피드백보다 더 의미 있는 지도를 제공했으며, 이는 더 빠르고 안정적인 학습을 이끌었다.
  • 비순차적 사전 훈련은 최종 성능과 샘플 효율성을 크게 향상시켰으며, 이는 교사가 다양한 일관된 행동에 대해 더 정보성 있는 피드백을 제공할 수 있도록 했다.
  • PEBBLE는 단지 50~200개의 인간 피드백 쿼리로도 새롭고 복잡한 행동—예를 들어 막대 흔들기, 앞다리 흔들기, 백플립—을 학습시키는 데 성공했다.
  • Walker 환경에서, PEBBLE는 SAC가 한쪽 다리만 사용해 걷는 보상 오용을 수정하여, 200개의 인간 피드백 쿼리를 사용해 더 자연스럽고 이원적인 보행 자세로 에이전트를 이끌었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.