Skip to main content
QUICK REVIEW

[논문 리뷰] Few-Shot Preference Learning for Human-in-the-Loop RL

Joey Hejna, Dorsa Sadigh|arXiv (Cornell University)|2022. 12. 06.
Reinforcement Learning in Robotics인용 수 15
한 줄 요약

이 논문은 메타학습을 활용해 다중 작업 데이터에서 보상 모델을 사전 훈련하여, 인공지능과 인간이 협력하는 강화학습 환경에서 소수의 인간 피드백 질의로도 빠른 적응이 가능한 소수의 선호 학습 방법을 제안한다. 이 방법은 메타월드에서 온라인 피드백 요구를 20배 감소시키며, 프랭카 펜다 로봇에서 실제 인간 사용자로부터 정책을 훈련하는 데에 기여한다.

ABSTRACT

While reinforcement learning (RL) has become a more popular approach for robotics, designing sufficiently informative reward functions for complex tasks has proven to be extremely difficult due their inability to capture human intent and policy exploitation. Preference based RL algorithms seek to overcome these challenges by directly learning reward functions from human feedback. Unfortunately, prior work either requires an unreasonable number of queries implausible for any human to answer or overly restricts the class of reward functions to guarantee the elicitation of the most informative queries, resulting in models that are insufficiently expressive for realistic robotics tasks. Contrary to most works that focus on query selection to \emph{minimize} the amount of data required for learning reward functions, we take an opposite approach: \emph{expanding} the pool of available data by viewing human-in-the-loop RL through the more flexible lens of multi-task learning. Motivated by the success of meta-learning, we pre-train preference models on prior task data and quickly adapt them for new tasks using only a handful of queries. Empirically, we reduce the amount of online feedback needed to train manipulation policies in Meta-World by 20$ imes$, and demonstrate the effectiveness of our method on a real Franka Panda Robot. Moreover, this reduction in query-complexity allows us to train robot policies from actual human users. Videos of our results and code can be found at https://sites.google.com/view/few-shot-preference-rl/home.

연구 동기 및 목표

  • 복잡한 로봇 작업을 위한 조밀하고 의도에 부합하는 보상 함수를 설계하는 과제를 해결하며, 이러한 보상 함수는 수동으로 설계하기 어려운 경우가 많다.
  • 이전의 선호 기반 강화학습 방법이 과도한 인간 질의를 요구하거나 보상 함수의 표현력을 제한하는 한계를 극복한다.
  • 기존의 다중 작업 데이터를 활용해 적응 속도를 높임으로써 데이터가 부족한 상황에서도 효율적인 정책 훈련을 가능하게 한다.
  • 모의 환경과 실제 로봇 환경에서 모두 실제 인간 피드백을 기반으로 한 조작 정책 학습의 가능성을 입증한다.

제안 방법

  • 다양한 로봇 조작 작업 간의 공통 보상 구조를 학습하기 위해, 이전 작업의 대규모 데이터셋에서 선호 모델을 사전 훈련한다.
  • 새로운 작업을 위해 단지 몇 개의 인간 제공 쌍 비교(예: '어느 궤도가 더 나은가요?')를 사용하여 사전 훈련된 모델을 미세조정한다.
  • 메타학습(특히 MAML)을 활용해 모델이 최소한의 기울기 업데이트로도 새로운 작업에 신속히 적응할 수 있도록 최적화한다.
  • 적응된 보상 모델을 기반으로 한 SAC 기반 강화학습 프레임워크를 적용하여 최소한의 온라인 인간 피드백으로 정책을 훈련한다.
  • 초기 세션에서는 균일한 샘플링을 사용하는 고정된 피드백 스케줄을 적용하고, 후속 단계에서는 불확실성 또는 이견 기반의 질의 선택을 수행한다.
  • 전문가 시뮬레이션의 궤도 세그먼트 또는 재라벨링된 상태를 활용해 인간 레이블링을 위한 정보성 높은 비교 질의를 생성한다.

실험 결과

연구 질문

  • RQ1다중 작업 데이터에서의 사전 훈련이 새로운 로봇 작업에 대해 고성능 보상 함수를 학습하기 위해 필요한 인간 피드백 질의 수를 크게 줄일 수 있는가?
  • RQ2메타학습이 표준 미세조정 또는 질의 선택 전략에 비해 선호 모델의 새로운 작업에 대한 적응 속도를 빠르게 할 수 있는가?
  • RQ3제안된 방법이 시뮬레이션과 실제 로봇 환경 모두에서 실제 인간 피드백을 기반으로 효과적인 로봇 정책을 훈련시킬 수 있는가?
  • RQ4질의 효율성과 최종 정책 성능 측면에서, 이 방법은 최신의 능동 선호 학습 기준선과 비교해 어떻게 성과를 내는가?

주요 결과

  • 메타월드 벤치마크에서 이전 최고 수준의 방법에 비해 인간 피드백 질의 수를 20배 감소시켰다.
  • 이전 방법이 높은 질의 요구로 인해 달성하지 못했던 바, 제안된 방법은 실제 인간 피드백을 기반으로 조작 정책을 훈련시킬 수 있다.
  • 프랭카 펜다 로봇에서 이 방법은 실세계 환경에서 단 200개의 인간 피드백 질의로도 도달 및 밀기 정책을 성공적으로 훈련시켰다.
  • 소수의 선호 학습 방법은 PEBBLE와 같은 기준선에 비해 더 정보성 높은 질의를 선택하며, 사용자들이 제안된 방법으로 생성된 비교 옵션을 일관되게 선호하는 것으로 나타났다.
  • 사용자 평가에서 제안된 방법의 질의는 더 명확한 시각적 차이(예: 닫힌 문 대비 열린 문) 덕분에 더 쉽게 답변할 수 있었으며, 이는 레이블링 효율성을 향상시켰다.
  • 메타월드의 여러 작업, 특히 윈도우 닫기 및 도어 닫기 작업에서, 이 방법은 RCE 및 PEBBLE보다 샘플 효율성과 최종 정책 성능 측면에서 모두 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.