Skip to main content
QUICK REVIEW

[논문 리뷰] Learning a Universal Human Prior for Dexterous Manipulation from Human Preference

Zihan Ding, Yuanpei Chen|arXiv (Cornell University)|2023. 04. 10.
Robot Manipulation and Learning인용 수 4
한 줄 요약

이 논문은 인간의 선호도 평가를 기반으로 한 강화학습(RLHF) 프레임워크를 제안하며, 로봇 궤적 영상에 대한 인간의 선호도 판단을 통해 유연한 조작을 위한 통합된 인간 사전지식을 학습한다. 수차례의 정교화 반복을 통해 다양한 정책을 생성하고, 인간의 선호도를 수집하며, 임무에 종속되지 않는 보상 모델을 훈련시킴으로써, 20개의 시뮬레이션된 유연한 조작 작업 전반에서 정책의 자연스러움과 임무 성능을 향상시킨다. 네 번의 정교화 반복 후 원본 정책 대비 선호도 확률이 22.3% 향상되었으며, 예측되지 않은 작업으로의 일반화 및 시뮬레이션에서 실제 로봇으로의 전이도 가능하다.

ABSTRACT

Generating human-like behavior on robots is a great challenge especially in dexterous manipulation tasks with robotic hands. Scripting policies from scratch is intractable due to the high-dimensional control space, and training policies with reinforcement learning (RL) and manual reward engineering can also be hard and lead to unnatural motions. Leveraging the recent progress on RL from Human Feedback, we propose a framework that learns a universal human prior using direct human preference feedback over videos, for efficiently tuning the RL policies on 20 dual-hand robot manipulation tasks in simulation, without a single human demonstration. A task-agnostic reward model is trained through iteratively generating diverse polices and collecting human preference over the trajectories; it is then applied for regularizing the behavior of polices in the fine-tuning stage. Our method empirically demonstrates more human-like behaviors on robot hands in diverse tasks including even unseen tasks, indicating its generalization capability.

연구 동기 및 목표

  • 표준 강화학습 훈련에서 흔히 나타나는 비자연스럽거나 끈적한 동작을 피하면서 인간처럼 자연스러운 운동을 보이는 유연한 조작 정책을 훈련하는 데 도전하는 것.
  • 비용이 많이 드는 인간의 시범 또는 수동 보상 설계에 의존하는 것을 줄이고, 인간의 선호도 피드백을 인간 행동 기준의 확장 가능한 대체 척도로 활용하는 것.
  • 다양한 유연한 조작 작업, 포함하여 예측되지 않은 작업들에 일반화되는 단일의 임무에 종속되지 않는 보상 모델을 학습하는 것.
  • 시범 없이 선호도 신호만으로도 시뮬레이션 내 정책 정교화 및 시뮬레이션에서 실제 환경으로의 전이를 효율적으로 가능하게 하는 것.
  • 인간 선호도 피드백이 에너지 효율성, 관절 안전성, 인간 기준 준수 행동으로 정책을 정규화하는 데 효과적으로 작용할 수 있는지 조사하는 것.

제안 방법

  • 20개의 유연한 조작 작업 전반에서 다양한 정책을 생성하고, 영상 궤적에 대한 인간 선호도 레이블을 수집하며, 레이블된 피드백에서 임무에 종속되지 않는 보상 모델(RM)을 훈련하는 반복적 파이프라인을 순환한다.
  • 보상 모델은 궤적 쌍을 비교하여 어느 운동이 더 인간다운지 예측할 수 있도록 하는 선호도 학습 목표를 사용하여 훈련된다.
  • 임무별 보상(예: 성공 신호)과 RM에서 유도된 인간 선호도 보상의 하이브리드 목표를 결합하여 정책을 정교화하며, 두 신호의 균형을 맞추기 위해 적응형 스케일링을 사용한다.
  • 정책 정교화 중 탐색을 장려하기 위해 PPO에 엔트로피 보너스를 사용하며, 동시에 RM이 인간 기준에 따라 행동을 이끌어낸다.
  • 로봇 운동 영상에 대한 인간 선호도 피드백을 수집하기 위해 전용 플랫폼을 구축하였으며, 다양한 작업에 걸쳐 고품질의 레이블링을 보장한다.
  • 최종 RM은 보기에 보이지 않는 작업과 볼 수 있는 작업 모두에서 정책 정교화에 적용되어, 제로샷 일반화 및 시뮬레이션에서 실제 환경으로의 전이를 가능하게 한다.

실험 결과

연구 질문

  • RQ1시범 없이 영상 궤적에 대한 인간 선호도 피드백이 유연한 조작을 위한 통합된 인간 사전지식을 효과적으로 학습할 수 있는가?
  • RQ2단일의 임무에 종속되지 않는 보상 모델이 예측되지 않은 유연한 조작 작업으로 얼마나 잘 일반화되는가?
  • RQ3인간 선호도 보상 모델을 사용해 정책을 정교화하면 임무 성능과 운동의 인간다움이 모두 향상되는가?
  • RQ4하이퍼파rameter 선택(예: 스케일링 계수) 중 어떤 것이 정책 정교화에서 임무 성공률과 인간다움의 균형에 크게 영향을 미치는가?
  • RQ5어떤 작업에서 RM이 인간다운 행동으로 정책을 이끌지 못하는가, 그리고 그 이유는 무엇인가?

주요 결과

  • 네 번의 정교화 반복 후 원본 강화학습 정책 대비 선호도 확률이 22.3% 향상되어, 인간다운 행동을 학습하는 데 있어 뛰어난 효과를 입증했다.
  • 임무에 종속되지 않는 보상 모델이 예측되지 않은 유연한 조작 작업으로 성공적으로 일반화되었으며, 선호도 점수와 임무 성공률 모두 향상되었다.
  • 시뮬레이션에서 실제 환경으로의 전이가 성공적으로 이루어져, 이 방법의 강건성과 실제 로봇 시스템에의 실용적 적용 가능성을 시사했다.
  • Eq. 3의 하이브리드 목표(임무 보상과 인간 선호도 보상의 균형)를 사용할 경우, 표준 RLHF 목표(식 14)보다 더 나은 종합 성능을 달성했으며, 후자는 높은 선호도 점수에도 불구하고 임무 완료 성능이 떨어졌다.
  • 인간 선호도 보상의 스케일링 계수 $ c $ 를 적응형으로 조정하고 $ \alpha $ 를 적절히 선택함으로써 임무 성공률이 크게 향상되었으며, 하이퍼파rameter 조정의 민감성이 드러났다.
  • Kettle 및 DoorCloseOutward와 같은 어려운 작업에서는 RM이 열악한 탐색을 보완하지 못했고, SwingCup에서는 초기에 다양하게 생성된 정책에 인간다운 행동이 부족해 학습이 어려웠다. 이는 작업별로 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.