Skip to main content
QUICK REVIEW

[논문 리뷰] DexTransfer: Real World Multi-fingered Dexterous Grasping with Minimal Human Demonstrations

Zoey Qiuyu Chen, Karl Van Wyk|arXiv (Cornell University)|2022. 09. 28.
Robot Manipulation and Learning인용 수 10
한 줄 요약

DexTransfer는 23-DoF Allegro 손에 대해 인간의 최소한의 운동 캡처 데이터를 활용하여 다양하고 성공적인 잡기 경로를 생성하는 데이터 증강 프레임워크를 제안한다. 인간의 운동을 로봇에 리타겟팅하고, 기울기 없는 최적화를 통해 경로를 정밀 조정하며 도메인 랜덤화를 적용함으로써, 시뮬레이션에서의 점군 관측치에 기반한 정책이 예측되지 않은 물체 자세와 초기 손 구성 조건에 대해 실제 세계에서 최대 72%의 성공률을 달성할 수 있도록 한다.

ABSTRACT

Teaching a multi-fingered dexterous robot to grasp objects in the real world has been a challenging problem due to its high dimensional state and action space. We propose a robot-learning system that can take a small number of human demonstrations and learn to grasp unseen object poses given partially occluded observations. Our system leverages a small motion capture dataset and generates a large dataset with diverse and successful trajectories for a multi-fingered robot gripper. By adding domain randomization, we show that our dataset provides robust grasping trajectories that can be transferred to a policy learner. We train a dexterous grasping policy that takes the point clouds of the object as input and predicts continuous actions to grasp objects from different initial robot states. We evaluate the effectiveness of our system on a 22-DoF floating Allegro Hand in simulation and a 23-DoF Allegro robot hand with a KUKA arm in real world. The policy learned from our dataset can generalize well on unseen object poses in both simulation and the real world

연구 동기 및 목표

  • 높은 차원의 상태 및 행동 공간으로 인해 인간 데모가 제한적인 상황에서 민감한 로봇 손 잡기 정책을 훈련하는 데 도전하는 문제를 해결한다.
  • 다중 손가락 손에 대한 대규모 인간 데모 수집의 한계를 극복하기 위해 소규모 운동 캡처 데이터셋을 활용한다.
  • 다양하고 성공적인 경로를 시뮬레이션에서 생성하는 확장 가능한 데이터 증강 파이프라인을 개발하여 정책의 일반화 능력을 향상시킨다.
  • 시뮬레이션에서 훈련된 정책을 실제 로봇 시스템으로 안정적으로 전이시키며, 예측되지 않은 물체 자세와 초기 손 구성 조건을 포함한다.
  • 연속적인 행동 예측을 통한 점군 관측치에서의 학습이 고정된 자세 기반 기준보다 훨씬 뛰어나다는 것을 입증한다.

제안 방법

  • 비선형 최적화 프레임워크를 사용하여 인간의 운동 캡처 데이터를 시뮬레이션된 민감한 로봇 손에 리타겟팅함으로써 상대적 손가락 및 물체 자세 역학을 유지한다.
  • 손가락 관절 이동, 물체 대비 자세, 손바닥 방향 정렬을 조합한 비용 최소화 문제로 리타겟팅을 공식화하며, 정확도와 실현 가능성 간 균형을 맞추기 위해 가중치를 적용한다.
  • 지역적 기울기 없는 최적화를 사용하여 리타겟팅된 경로를 정밀 조정하여 성공률을 향상시키고 시뮬레이션 내에서 동적 실현 가능성을 확보한다.
  • 물체 자세와 초기 손 구성 조건을 변형시켜 유도적 데이터 증강을 적용함으로써 데이터셋의 다양성과 일반화 능력을 증가시킨다.
  • 3차원 점군을 연속적인 관절 동작으로 매핑하는 딥 강화 학습 정책을 훈련시켜 원시 감각 입력에서 종단 간 잡기 제어를 가능하게 한다.
  • RGB-D 인식과 고수준 기하학적 패브릭스 제어를 사용하여, 실세계의 23-DoF KUKA Allegro 로봇 암과 PD 제어 손을 사용해 학습된 정책을 전이한다.

실험 결과

연구 질문

  • RQ1소수의 인간 데모가 시뮬레이션과 실제 세계에서 예측되지 않은 물체 자세에 대해 일반화되는 민감한 잡기 정책을 효과적으로 재사용할 수 있는가?
  • RQ2경로 정밀 조정과 데이터 증강이 단순한 데모 리타겟팅에 비해 정책의 성공률을 얼마나 향상시키는가?
  • RQ3도메인 랜덤화가 시뮬레이션에서 실세계 로봇 하드웨어로의 제로샷 전이를 얼마나 효과적으로 가능하게 하는가?
  • RQ4점군 관측치에서 학습된 정책이 고정된 구성 정책이나 최근접 이웃 기반 기준보다 더 잘 일반화되는가?
  • RQ5예측된 점군에서 연속적인 행동을 학습하는 것이 사전 정의된 손가락 자세에 비해 실세계의 잡기 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 DexTransfer 시스템은 예측되지 않은 물체 자세에서 실세계에서 72%의 성공률을 기록하여 기준 방법들을 크게 능가한다.
  • 연속적인 행동 예측을 통한 점군 입력 기반 정책은 11%의 성공률을 기록하여 고정된 자세에 비해 적응형 제어의 필요성을 입증한다.
  • 최근접 이웃 기반 기준은 오직 14%의 성공률을 기록하여, 학습된 정책이 기억에 의존하는 것을 넘어 새로운 물체 및 손 구성 조건으로 일반화된다는 것을 시사한다.
  • 시뮬레이션에서 정책은 예측되지 않은 물체 자세와 초기 로봇 상태에 대해 잘 일반화되며, 분포 이탈에 대한 강건성을 확인한다.
  • 실세계에서 모든 테스트 물체에 대해 40% 이상의 성공률을 기록했으며, 일부는 최대 70%까지 도달하여 도메인 랜덤화와 데이터 증강의 효과를 검증한다.
  • 실세계의 23-DoF KUKA Allegro 로봇 손에 대해 시뮬레이션에서 훈련된 정책을 성공적으로 전이하였으며, RGB-D 인식과 고수준 기하학적 패브릭스 제어를 통한 전이가 가능했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.