Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Purely Tactile In-Hand Manipulation with a Torque-Controlled Hand

Leon Sievers, Johannes Pitz|arXiv (Cornell University)|2022. 04. 07.
Robot Manipulation and Learning인용 수 6
한 줄 요약

이 논문은 토크 제어가 가능한 인간형 손에 대해 시뮬레이션에서 오프정책 딥 강화학습을 사용하여 도메인 적응형 커리큘럼을 적용한 첫 번째 성공적인 학습 기반 순수 촉각적 손안에서의 조작 정책을 제시한다. 이 정책는 오직 관절 위치 및 토크 피드백만을 사용하여 실세계 실험에서 외부 상태 추정이나 시각 피드백 없이도 교란 요소가 존재하더라도 안정적으로 연속적인 2π 회전을 수행하며, 실세계에서 46회 이상의 완전한 회전을 달성한다.

ABSTRACT

We show that a purely tactile dextrous in-hand manipulation task with continuous regrasping, requiring permanent force closure, can be learned from scratch and executed robustly on a torque-controlled humanoid robotic hand. The task is rotating a cube without dropping it, but in contrast to OpenAI's seminal cube manipulation task, the palm faces downwards and no cameras but only the hand's position and torque sensing are used. Although the task seems simple, it combines for the first time all the challenges in execution as well as learning that are important for using in-hand manipulation in real-world applications. We efficiently train in a precisely modeled and identified rigid body simulation with off-policy deep reinforcement learning, significantly sped up by a domain adapted curriculum, leading to a moderate 600 CPU hours of training time. The resulting policy is robustly transferred to the real humanoid DLR Hand-II, e.g., reaching more than 46 full 2$π$ rotations of the cube in a single run and allowing for disturbances like different cube sizes, hand orientation, or pulling a finger.

연구 동기 및 목표

  • 시각 피드백이나 외부 물체 상태 추정에 의존하지 않는 순수 촉각적 손안에서의 조작 정책을 개발한다.
  • 지속적인 힘으로 잡고 있는 상태에서의 연속적인 재그립을 효과적으로 학습하는 문제를 해결한다. 이는 학습 중에 그립을 유지해야 하므로 탐색이 제한되기 때문이다.
  • 고도의 자유도를 가진 인간형 로봇 손에서 복잡한 촉각 조작 작업에 대해 효율적인 시뮬레이션에서 실세계로의 전이를 달성한다.
  • 손 위치 변경, 손가락 끌기, 물체 크기 변화와 같은 실세계의 교란 요소에 대한 강건성을 입증한다.
  • DLR Hand-II의 내장된 관절 및 토크 센서만을 사용하여 46회 이상의 장수평 조작(2π 회전)을 가능하게 한다.

제안 방법

  • DLR Hand-II의 고정밀 강체 시뮬레이션 모델을 사용하여 토크 기반 임피던스 제어를 적용한 오프정책 소프트 액터-크리틱(SAC) 기반 딥 강화학습 정책을 학습시켰다.
  • 시뮬레이션 하이퍼파라미터(예: 필터 상수, 중력)를 조정하여 수렴 속도를 높이고 시뮬레이션에서 실세계로의 전이를 향상시키는 도메인 적응형 커리큘럼을 통합했다.
  • 외부 상태 추정이나 시각 정보 없이 오직 내장된 관절 위치 및 출력 측면의 토크 센서 읽기만을 관측으로 사용하여, 외부 상태 추정이 필요 없도록 했다.
  • 드라이브트레인의 탄성 및 슬립-스티크 마찰을 토크 컨트롤러 추상화 방식을 통해 고정밀하게 모델링한 시뮬레이션 모델을 구현했다.
  • 도메인 랜덤라이제이션과 시뮬레이션 식별을 적용하여 강건성 향상과 정확한 실세계 전이를 확보했다.
  • 정책의 능력을 확장하기 위해 계속 학습(continuation training)을 통해 정사각형 이외의 알려진 기하 형태인 직육면체와 같은 물체에 대한 조작 능력을 확보했다.

실험 결과

연구 질문

  • RQ1시각 피드백 없이 처음부터 순수 촉각적 손안에서의 조작 정책을 학습시켜 실제 토크 제어가 가능한 인간형 손으로 성공적으로 전이시킬 수 있는가?
  • RQ2지속적인 힘으로 잡고 있는 상태에서 탐색이 제한되는 상황에서 연속적인 재그립을 효과적으로 학습할 수 있는가?
  • RQ3도메인 적응형 커리큘럼이 촉각 조작 작업에 대해 학습 속도를 가속화하고 시뮬레이션에서 실세계로의 전이를 향상시키는 데 어떤 역할을 하는가?
  • RQ4학습된 정책이 손가락 끌기, 손 위치 재정렬, 물체 크기 변화와 같은 실세계의 교란 요소를 어느 정도 견딜 수 있는가?
  • RQ5정책을 정사각형에서 학습시킨 후, 정밀 조정을 통해 직육면체와 같은 다른 알려진 형태의 물체로 일반화할 수 있는가?

주요 결과

  • 실세계 실험에서 정책은 단일 실행 동안 46회 이상의 완전한 2π 회전(289 rad)을 달성하여 뛰어난 장수평 안정성을 입증했다.
  • 실세계 실험 10회 중 8회가 성공했으며, 성공 기준은 최고의 시뮬레이션 성능의 80% 이상이었고, 이는 강력한 시뮬레이션에서 실세계로의 전이를 확인한다.
  • 정책는 오픈 루프 수동 조작 경로와 재생된 관절 각도 시퀀스보다도 우수한 성능를 보였으며, 이들은 불안정성으로 인해 단지 π/2 라디안 이후에 실패했다.
  • 정책는 손가락 끌기, 손 위치 재정렬, 물체 크기 변화까지 최대 2cm까지의 예측 불가능한 교란 요소에 대해 강건성을 보였다.
  • 링크 측면의 토크 센서를 사용함으로써 제어 오차를 감지하고 실패를 회복할 수 있었으며, 이는 폐쇄 루프 적응을 가능하게 했다.
  • 정밀 조정을 통해 정책는 직육면체 조작을 성공적으로 수행할 수 있었으며, 원래의 정사각형 작업을 넘어선 알려진 기하 형태의 물체로의 일반화를 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.