Skip to main content
QUICK REVIEW

[논문 리뷰] Skill Preferences: Learning to Extract and Execute Robotic Skills from Human Feedback

Xiaofei Wang, Kimin Lee|arXiv (Cornell University)|2021. 08. 11.
Reinforcement Learning in Robotics참고 문헌 36인용 수 7
한 줄 요약

Skill Preferences (SkiP)는 오프라인 데이터에서 노이즈가 많고 비최적인 시연 데이터로부터 인간이 원하는 구조적 스킬을 학습하기 위해 스킬 추출 및 실행 단계에서 인간 피드백을 활용하는 강화학습 프레임워크이다. 궤적에 대한 인간의 선호도를 모델링함으로써 SkiP는 인간의 의도와 일치하는 강력한 행동 사전을 추출하며, 이는 시뮬레이션에서 복잡한 다단계 로봇 조작 작업에서 기존의 스킬 추출 및 인간-중심 강화학습 방법보다 뛰어난 성능을 보인다.

ABSTRACT

A promising approach to solving challenging long-horizon tasks has been to extract behavior priors (skills) by fitting generative models to large offline datasets of demonstrations. However, such generative models inherit the biases of the underlying data and result in poor and unusable skills when trained on imperfect demonstration data. To better align skill extraction with human intent we present Skill Preferences (SkiP), an algorithm that learns a model over human preferences and uses it to extract human-aligned skills from offline data. After extracting human-preferred skills, SkiP also utilizes human feedback to solve down-stream tasks with RL. We show that SkiP enables a simulated kitchen robot to solve complex multi-step manipulation tasks and substantially outperforms prior leading RL algorithms with human preferences as well as leading skill extraction algorithms without human preferences.

연구 동기 및 목표

  • 현실 세계에서는 드물게 이용 가능한 정제된 전문가 수준의 시연 데이터에 의존하는 기존 스킬 추출 방법의 한계를 해결한다.
  • 불완전하거나 비최적의 오프라인 데이터로 훈련된 생성 모델의 취약성을 인간 피드백을 통합하여 행동 사전를 노이즈 제거하고 인간의 의도와 일치시킴으로써 극복한다.
  • 인간 피드백을 정책 미세조정뿐만 아니라 스킬 탐색에도 활용하여 인간-중심 강화학습을 장수평, 조합형 작업으로 확장한다.
  • 스킬 추출 단계에서 궤적에 대한 선호도를 모델링하여 다중 모odal, 노이즈가 많은 데이터셋으로부터 효율적이고 강력한 스킬 학습을 가능하게 한다.
  • 데이터가 비최적일 경우, 스킬 추출 단계에서 인간 피드백이 복잡한 최종 작업에서 높은 성능을 달성하는 데 필수적임을 입증한다.

제안 방법

  • 쌍별 비교를 통해 오프라인 데이터셋 내 궤적에 대한 인간 선호도 모델을 학습한다.
  • 학습된 선호도 모델을 사용하여 스킬 추출 동안 궤적의 가능성을 재가중함으로써 인간 의도와 일치하는 궤적을 우선시한다.
  • 선호도 가중치가 적용된 데이터셋을 기반으로 생성 모델(예: VAE 또는 순차 모델)을 훈련하여 구조적이고 인간이 선호하는 스킬을 추출한다.
  • 추출된 스킬을 하류 강화학습 루프에서 행동 사전으로 활용하며, 특정 작업을 위한 정책을 인간 피드백을 통해 미세조정한다.
  • 강화학습 미세조정 동안 선호도 기반 보상 신호를 사용하여 정책 최적화를 인간이 선호하는 행동으로 유도한다.
  • 스킬 추출 시 피드백과 스킬 실행 시 피드백의 두 단계를 통합된 파이프라인으로 통합하여 샘플 효율성과 작업 성능을 향상시킨다.

실험 결과

연구 질문

  • RQ1노이즈가 많고 비최적인 오프라인 데이터로 훈련할 때, 스킬 추출 단계에서 인간 피드백이 행동 사전의 품질을 향상시키는가?
  • RQ2스킬 추출 단계에서 선호도를 통합하면 피드백이 없는 표준 스킬 추출 방식보다 하류 작업 성능이 향상되는가?
  • RQ3선호도 기반 피드백은 이진 피드백(예: 하위작업 완료 여부)과 비교해 샘플 효율성과 최종 성능 측면에서 어떻게 다른가?
  • RQ4인간 피드백을 통한 스킬 추출이 조합적 사고가 필요한 복잡한 장수평 조작 작업으로 일반화되는가?
  • RQ5수동적인 데이터셋 정제를 인간 피드백을 통한 스킬 학습으로 대체함으로써 정제된 전문가 시연에 대한 의존도를 줄일 수 있는가?

주요 결과

  • SkiP가 스킬 추출 단계에서 인간 피드백을 사용할 경우, 모든 6개의 시뮬레이션 주방 환경에서 피드백 없이 사용한 버전보다 뛰어난 성능을 보이며, 후자는 어떤 작업도 해결하지 못했다.
  • 인간 피드백을 통한 스킬 추출을 사용하는 방법은 가중치가 없는 베이스라인 대비 더 빠른 학습 곡선과 높은 최종 성능을 기록하여, 사전 학습 단계에서 선호도 모델링의 필요성을 입증한다.
  • 하류 강화학습에서 인간 선호도를 사용한 SkiP가 학습된 이진 보상 분류기(스parse reward classifier)를 사용한 동일한 방법보다 6개 환경 중 5개에서 뛰어난 성능을 보이며, 선호도 신호가 이진 하위작업 보상보다 더 정보가 많음을 시사한다.
  • SkiP는 시뮬레이션 주방 환경에서 복잡한 다단계 조작 작업에 대해 인간-중심 강화학습의 최첨단 알고리즘과 최첨단 스킬 추출 기반 방법보다 뚜렷이 뛰어난 성능을 보였다.
  • 선호도 가중치가 적용된 스킬 추출 과정은 전문가 행동과 무작위 행동의 혼합된 데이터셋에서도 인간이 원하는 고품질 궤적을 성공적으로 식별하고 강조함으로써 데이터 노이즈에 대한 강건성을 입증했다.
  • 결과는 인간 피드백이 스킬 추출 단계에서 유익할 뿐 아니라, 불완전한 데이터로 도전적인 장수평 작업에서 신뢰할 수 있는 성능을 달성하기 위해 필수적임을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.