Skip to main content
QUICK REVIEW

[논문 리뷰] Transferring Dexterous Manipulation from GPU Simulation to a Remote Real-World TriFinger

Arthur Allshire, Mayank Mittal|arXiv (Cornell University)|2021. 08. 22.
Robot Manipulation and Learning참고 문헌 25인용 수 15
한 줄 요약

이 논문은 도메인 랜덤라이제이션과 키포인트 기반 관측 및 보상과 함께 GPU 가속 시뮬레이션에서 훈련된 통합 딥 강화학습 정책을 제안한다. 이는 TriFinger 로봇에서 6-DoF 손안에서의 다재다능한 조작을 위한 것으로, 원격 실세계 TriFinger에서 시뮬레이션에서 실제 환경으로의 전이 성공률이 83%에 달하며, 새로운 물체에 일반화되어 단일 정책으로 견고한 抓거, 해제, 재배치를 가능하게 한다.

ABSTRACT

We present a system for learning a challenging dexterous manipulation task involving moving a cube to an arbitrary 6-DoF pose with only 3-fingers trained with NVIDIA's IsaacGym simulator. We show empirical benefits, both in simulation and sim-to-real transfer, of using keypoints as opposed to position+quaternion representations for the object pose in 6-DoF for policy observations and in reward calculation to train a model-free reinforcement learning agent. By utilizing domain randomization strategies along with the keypoint representation of the pose of the manipulated object, we achieve a high success rate of 83% on a remote TriFinger system maintained by the organizers of the Real Robot Challenge. With the aim of assisting further research in learning in-hand manipulation, we make the codebase of our system, along with trained checkpoints that come with billions of steps of experience available, at https://s2r2-ig.github.io

연구 동기 및 목표

  • 실세계 로봇 손을 대상으로 하는 임의의 6-DoF 물체 재배치를 포함한 복잡한 손안에서의 조작 작업을 위한 견고하고 통합된 강화학습 정책을 개발하기 위해.
  • 고품질 시뮬레이션과 도메인 랜덤라이제이션을 활용하여 다재다능한 조작에서의 시뮬레이션에서 실제 환경으로의 전이 과제를 해결하기 위해.
  • 스케일이 가능한 훈련과 키포인트 기반 표현을 통해 새로운 물체와 물리적 매개변수 변화에 대한 정책 일반화를 향상시키기 위해.
  • 물리적 접근 없이도 원격 클라우드 기반 로봇 시스템에 배포할 수 있도록 하여, 전체 플릿에 걸친 배포 환경에서의 견고성을 입증하기 위해.
  • 훈련된 체크포인트를 포함한 재현 가능한 오픈소스 프레임워크를 제공하여 향후 시뮬레이션에서 실제 환경으로의 다재다능한 조작 연구를 가속화하기 위해.

제안 방법

  • 고속 GPU 가속 MuJoCo 시뮬레이션 환경에서 도메인 랜덤라이제이션을 활용하여, 안정적인 시뮬레이션에서 실제 환경으로의 전이를 위한 모델-프리 딥 강화학습 에이전트를 훈련시켰다.
  • 6-DoF 조작에서 학습 효율성과 일반화를 향상시키기 위해 정책 관측과 조밀한 보상 함수 모두에서 물체 자세를 키포인트 기반 표현으로 사용하였다.
  • 단일 통합 정책가 물체를 抓거, 해제, 재배치할 수 있도록, 수십억 개의 환경 스텝에 걸쳐 대규모 훈련을 수행하였다.
  • 실제 접근 없이도 실제 성능을 검증하기 위해 클라우드 기반 TriFinger 로봇 플랫폼을 활용한 원격 로봇-인-더-루프 훈련 루프를 통합하였다.
  • 특히 크기 변화에 대한 일반화를 향상시키기 위해 새로운 물체 형태와 크기에 대해 피니팅(fine-tuning)을 적용하였다.
  • 추론 시에는 오프더쇼프 포즈 추정(예: YOLO 기반 검출기)을 사용하여 최소한의 재훈련으로도 실제 환경 배포를 가능하게 하였다.
(a) OpenAI’s shadow hand setup. The cube starts placed in the hand.
(a) OpenAI’s shadow hand setup. The cube starts placed in the hand.

실험 결과

연구 질문

  • RQ1단일 딥 강화학습 정책이 시뮬레이션에서 6-DoF 손안에서의 조작을 성공적으로 학습하고, 실제 세계로 안정적으로 전이될 수 있는가?
  • RQ2관측 및 보상에 키포인트 기반 물체 자세 표현을 사용할 경우, 기존의 위치+쿼터니언 표현과 비교해 시뮬레이션에서 실제 환경으로의 전이 성공률과 훈련 안정성에서 어떤 차이가 있는가?
  • RQ3피팅(fine-tuning) 없이도 단일 정책이 새로운 물체 형태와 크기에 얼마나 일반화될 수 있는가?
  • RQ4원격 클라우드 기반 로봇 플랫폼에서 도메인 랜덤라이제이션은 높은 시뮬레이션에서 실제 환경으로의 전이 성능을 달성하는 데 얼마나 효과적인가?
  • RQ5실제 환경 배포에서 물체를 떨어뜨리는 등의 실패 상황에서 정책이 자율적으로 복구하고 재그립할 수 있는가?

주요 결과

  • 키포인트 기반 관측 및 보상(O-KP+R-KP)을 사용한 정책은 실제 TriFinger 로봇에서 82.5%의 성공률을 기록하여 모든 아블레이션(Ablations)을 초월하였다.
  • 키포인트 기반 보상으로 훈련된 정책는 위치+쿼터니언 기반 보상으로 훈련된 정책(55% 및 60%)보다 훨씬 높은 성공률(77.5% 및 82.5%)을 보였다.
  • 예측되지 않은 크기의 상자형 물체에 대해 제로샷 일반화 성공률은 46.8%였고, 피니팅 후 72.9%로 향상되어 크기가 일반화에 더 중요한 요소임을 시사하였다.
  • 특히 도전적인 목표 위치에서 자세 정확도와 안정성을 향상시키기 위해 '떨어뜨리고 재그립하는' 잠재적 행동이 부상하여 나타났다.
  • 물리적 접근 없이도 시뮬레이션에서 원격 실세계 TriFinger 로봇으로 성공적으로 전이되었으며, 전체 플릿에 걸친 클라우드 기반 배포 환경에서의 견고성을 입증하였다.
  • EGAD 벤치마크에서 새로운 물체에 대해 피니팅을 수행한 결과, 제로샷 성공률 84.9%에서 87.2%로 향상되어 도메인 시프트 보완을 위한 피니팅의 효과성을 확인하였다.
(b) The Trifinger setup. The object starts outside of the hand to enable reset-free setup.
(b) The Trifinger setup. The object starts outside of the hand to enable reset-free setup.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.