[논문 리뷰] DeXtreme: Transfer of Agile In-hand Manipulation from Simulation to Reality
이 논문은 RGB 카메라와 시뮬레이션에서 실제 환경으로의 전이 기반 강화학습을 사용하여 저비용의 Allegro 손에만 의존해 민첩한 손 안에서의 조작을 가능하게 하는 DeXtreme를 제안한다. Isaac Gym의 완전히 미분 가능한 도메인 랜덤라이제이션 시뮬레이션 파이프라인을 사용하여 8장의 A40 GPU만으로도 객체 재정렬 작업에서 최신 기준 성능을 달성하며, 특수한 운동 캡처 기반 기준선과 동등한 성능을 보인다.
Recent work has demonstrated the ability of deep reinforcement learning (RL) algorithms to learn complex robotic behaviours in simulation, including in the domain of multi-fingered manipulation. However, such models can be challenging to transfer to the real world due to the gap between simulation and reality. In this paper, we present our techniques to train a) a policy that can perform robust dexterous manipulation on an anthropomorphic robot hand and b) a robust pose estimator suitable for providing reliable real-time information on the state of the object being manipulated. Our policies are trained to adapt to a wide range of conditions in simulation. Consequently, our vision-based policies significantly outperform the best vision policies in the literature on the same reorientation task and are competitive with policies that are given privileged state information via motion capture systems. Our work reaffirms the possibilities of sim-to-real transfer for dexterous manipulation in diverse kinds of hardware and simulator setups, and in our case, with the Allegro Hand and Isaac Gym GPU-based simulation. Furthermore, it opens up possibilities for researchers to achieve such results with commonly-available, affordable robot hands and cameras. Videos of the resulting policy and supplementary information, including experiments and demos, can be found at https://dextreme.org/
연구 동기 및 목표
- 낮은 하드웨어 및 인프라를 사용하여 시뮬레이션에서 실세계 로봇 손으로의 다재성 조작 정책 전이 문제를 해결한다.
- 마커 기반 추적 또는 특수 센서 없이도 저비용의 오프더쇼프 로봇 손에서 고성능의 뷰 기반 손 안에서의 조작을 가능하게 한다.
- 대규모 CPU 클러스터와 고비용 하드웨어가 필요한 이전의 시뮬레이션에서 실제 환경으로의 전이 방법에 비해 계산 비용과 복잡성을 감소시킨다.
- 도메인 랜덤라이제이션과 커리큘럼 학습을 통해 다양한 물리적 조건과 물체 자세에 일반화되는 견고한 종단 간 시스템을 개발한다.
- 재현 가능성을 위해 코드와 학습 파이프라인을 공개하여 더 넓은 연구 공동체가 고도의 다재성 조작을 이용할 수 있도록 한다.
제안 방법
- GPU 가속 시뮬레이션 환경인 Isaac Gym에서 도메인 랜덤라이제이션을 적용한 뷰 기반 정책을 딥 강화학습(PPO)을 사용해 훈련한다.
- 자동 도메인 랜덤라이제이션(ADR)을 적용하여 물리적 파rameter(마찰, 감쇠, 강성)와 비물리적 요소(텍스처, 조명, 카메라 노이즈)를 랜덤화하여 시뮬레이션에서 실제 환경으로의 일반화를 향상시킨다.
- 세 대의 오프더쇼프 카메라에서 얻은 RGB 이미지로부터 6차원 물체 자세 추정기를 완전히 미분 가능한 방식으로 훈련하여 마커 없이 실시간 상태 추정을 가능하게 한다.
- 진행적 랜덤라이제이션을 사용한 커리큘럼 기반 훈련 전략을 도입하여 학습 안정성을 높이고 실제 환경의 변동성에 대한 강건성을 향상시킨다.
- 최적화된 추론과 카메라-로봇 캘리브레이션을 사용하여 실시간 추론 파이프라인을 구현하여 실제 로봇에서 정책과 자세 추정기를 동시에 실행한다.
- 실제 환경 상태를 시뮬레이션으로 다시 렌더링하여 실세계 데이터 증강을 수행함으로써 자세 추정기를 정교화하고 시뮬레이션에서 실제 환경으로의 격차를 줄인다.
![Figure 1 : The hardware setup used in this work, unlike [ 1 ] , is not housed in a cage, and our system is robust enough to perform the task in an open laboratory environment. The background in the image is alpha-blended for visibility.](https://ar5iv.labs.arxiv.org/html/2210.13702/assets/figures/setup.png)
실험 결과
연구 질문
- RQ1특수한 상태 정보 없이도 시뮬레이션에서 훈련된 뷰 기반 정책이 저비용 로봇 손에서 높은 성능의 손 안에서의 조작을 달성할 수 있는가?
- RQ2자동 도메인 랜덤라이제이션(ADR)이 특수한 상태 정보 없이 뷰 기반 설정에서 다재성 조작의 시뮬레이션에서 실제 환경으로의 격차를 얼마나 효과적으로 줄일 수 있는가?
- RQ3완전히 미분 가능한, 시뮬레이션에서 훈련된 자세 추정기가 무거운 가림과 실제 환경의 시각적 변형을 얼마나 잘 처리할 수 있는가?
- RQ48장의 A40 GPU와 오프더쇼프 하드웨어만을 사용하는 시스템이 400개의 CPU 서버와 고비용 운동 캡처 시스템이 필요한 이전의 방법을 초월할 수 있는가?
- RQ5도메인 랜덤라이제이션, 커리큘럼 학습, 실세계에서 시뮬레이션으로의 데이터 증강의 조합이 정책의 일반화 능력과 실제 환경에서의 성공률을 얼마나 향상시키는가?
주요 결과
- 뷰 기반 정책은 실제 환경에서 물체 재정렬 작업에서 92%의 성공률을 달성하여 문헌상 최고의 뷰 기반 방법을 초월했다.
- 운동 캡처를 사용한 마커 기반 방법과 동등한 성능을 보이며, 특수한 상태 정보 없이도 뷰 전용 시스템이 동등한 결과를 낼 수 있음을 입증했다.
- 무거운 가림과 다양한 조명 조건에서도 고정밀도를 유지하며 다양한 실제 환경 조건에서 강건하게 일반화되었다.
- 훈련에 단 8장의 NVIDIA A40 GPU만을 사용하여 OpenAI의 400개 서버 CPU 클러스터와 32장의 V100 GPU를 사용한 이전 방법 대비 계산 비용을 10배 감소시켜 진입 장벽을 크게 낮췄다.
- ADR와 점진적 랜덤라이제이션의 사용으로 안정적인 학습 과정이 유지되었고, 시뮬레이션에서 실제 환경으로의 전이가 향상되어 최고의 정책이 실제 환경 테스트에서 92%의 성공률을 기록했다.
- 고장난 엄지와 같은 하드웨어 결함에도 불구하고 다양한 물체 자세와 초기 자세에 대해 일반화 능력을 보이며 견고성을 입증했다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.