Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Dense Rewards for Contact-Rich Manipulation Tasks

Zheng Wu, Wenzhao Lian|arXiv (Cornell University)|2020. 11. 17.
Reinforcement Learning in Robotics참고 문헌 39인용 수 8
한 줄 요약

이 논문은 적대적 훈련 없이 다중 모odal 관측(예: 이미지 및 촉각 피드백)을 사용하여 접촉이 풍부한 조작 작업을 위한 밀도 높은 보상 함수를 학습하는 DREM을 제안한다. 단일 전문가 시퀀스에서 자기지도 후방 샘플링을 활용함으로써 DREM은 표본 효율적인 강화 학습을 가능하게 하는 잠재적 작업 진행도 표현을 학습한다. 이는 펜-홀 삽입 및 USB 삽입 작업에서 기존 방법들을 능가한다.

ABSTRACT

Rewards play a crucial role in reinforcement learning. To arrive at the desired policy, the design of a suitable reward function often requires significant domain expertise as well as trial-and-error. Here, we aim to minimize the effort involved in designing reward functions for contact-rich manipulation tasks. In particular, we provide an approach capable of extracting dense reward functions algorithmically from robots' high-dimensional observations, such as images and tactile feedback. In contrast to state-of-the-art high-dimensional reward learning methodologies, our approach does not leverage adversarial training, and is thus less prone to the associated training instabilities. Instead, our approach learns rewards by estimating task progress in a self-supervised manner. We demonstrate the effectiveness and efficiency of our approach on two contact-rich manipulation tasks, namely, peg-in-hole and USB insertion. The experimental results indicate that the policies trained with the learned reward function achieves better performance and faster convergence compared to the baselines.

연구 동기 및 목표

  • 접촉이 풍부한 로봇 조작 작업을 위한 밀도 높은 보상 함수 설계에 필요한 수동 작업을 줄이기 위해.
  • 적대적 훈련에 의존하지 않고 고차원적, 다중 모달 관측(예: 시각 및 촉각 피드백)에서 밀도 높은 보상 학습을 가능하게 하기 위해.
  • 단일 전문가 시퀀스만을 사용하여 훈련 데이터를 생성하는 자기지도 데이터 수집 방법을 개발하기 위해.
  • 관측에서 작업 진행도의 대체 지표를 학습함으로써 강화 학습의 표본 효율성과 수렴 속도를 향상시키기 위해.
  • 복잡한 조작 작업을 위한 표준 강화 학습 알고리즘에 학습된 보상 함수를 원활하게 통합할 수 있도록 하기 위해.

제안 방법

  • DREM은 목표 상태에서 시작하여 후방 샘플링 전략을 사용하여 관측과 추정된 작업 진행도가 쌍으로 이루어진 데이터셋을 생성한다.
  • 고차원적 관측을 잠재 공간으로 매핑하는 인코더-디코더 네트워크를 훈련하여, 작업 진행도를 나타내는 잠재 표현을 학습하고, 이는 밀도 높은 보상 신호로 기능한다.
  • 적대적 훈련을 피하기 위해 자기지도 및 단일 전문가 경로를 활용하여 진행도 레이블을 정의한다.
  • 작업 진행도는 목표까지의 거리에 대한 연속적이고 단조로운 대체 지표로 간주되며, 잠재 공간에서의 대비 학습을 통해 학습된다.
  • 학습된 보상 함수는 Soft Actor-Critic와 같은 표준 강화 학습 알고리즘과 함께 사용되어 정책을 훈련시킨다.
  • 이 방법은 시각 및 촉각 센싱에서 흔히 볼 수 있는 고차원적이고 연속적인 관측 공간으로의 확장이 가능하도록 설계되어 있다.

실험 결과

연구 질문

  • RQ1적대적 훈련 없이 고차원적, 다중 모달 관측에서 밀도 높은 보상 함수를 학습할 수 있는가?
  • RQ2자기지도 데이터 수집을 통해 단일 전문가 시퀀스로 효과적인 밀도 높은 보상을 생성할 수 있는가?
  • RQ3잠재적 작업 진행도 표현을 학습함으로써 접촉이 풍부한 조작 작업에서 표본 효율성과 수렴 속도가 향상되는가?
  • RQ4실제 로봇 작업에서 DREM의 성능은 수작업으로 만든 보상 함수나 적대적으로 학습된 보상 함수와 비교해 어떻게 되는가?
  • RQ5학습된 보상 함수가 '접촉 중' 또는 '접촉 끊김'과 같은 작업 전용 개념을 포착할 수 있는가?

주요 결과

  • DREM이 학습한 보상 함수를 사용해 훈련된 정책는 펜-홀 삽입 및 USB 삽입 작업에서 수작업 또는 적대적으로 학습된 보상 함수를 사용한 정책보다 더 빠른 수렴과 더 나은 성능을 보였다.
  • 이 방법은 효과적인 밀도 높은 보상을 생성하기 위해 단 한 명의 전문가 시퀀스만을 요구하여 데이터 및 레이블링 비용을 크게 줄였다.
  • DREM의 자기지도 샘플링 프로세스는 대규모 전문가 경로가 필요 없이 다양한 훈련 데이터를 효율적으로 생성하였다.
  • 학습된 보상 함수는 이미지 및 촉각 피드백을 포함한 고차원적 관측에 대해 강건성을 보였으며, 효과적인 정책 학습을 가능하게 하였다.
  • DREM이 학습한 잠재 공간은 '접촉 중' 및 '접촉 끊김'과 같은 물리적 접촉 상태를 포함한 의미 있는 작업 진행 동역학을 포착하였다.
  • 실험 결과 DREM은 최종 작업 성공률 및 훈련 표본 효율성 측면에서 최신 보상 학습 기준선을 모두 능가하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.