Skip to main content
QUICK REVIEW

[논문 리뷰] Vision-based Teleoperation of Shadow Dexterous Hand using End-to-End Deep Neural Network

Shuang Li, Xiaojian Ma|arXiv (Cornell University)|2018. 09. 17.
Robot Manipulation and Learning참고 문헌 27인용 수 7
한 줄 요약

이 논문은 인간의 손 깊이 영상에서 바로 샤로우 다지털 로봇 손의 관절 각도로 매핑하는 엔드 투 엔드 딥 네트워크인 TeachNet을 제안한다. 이는 마커가 없는 직관적인 원격 조작을 가능하게 하며, 기존 최고 수준의 방법들과 비교해 초보자 사용자들이 더 빠르고 정확하게 抓握 작업을 수행할 수 있도록 한다. 이는 인간-로봇 깊이 영상 및 관절 각도 데이터셋(400만 건)을 활용하고 일관성 손실 함수를 적용하여 해부학적 및 외관적 차이를 다루는 데 기여한다.

ABSTRACT

In this paper, we present TeachNet, a novel neural network architecture for intuitive and markerless vision-based teleoperation of dexterous robotic hands. Robot joint angles are directly generated from depth images of the human hand that produce visually similar robot hand poses in an end-to-end fashion. The special structure of TeachNet, combined with a consistency loss function, handles the differences in appearance and anatomy between human and robotic hands. A synchronized human-robot training set is generated from an existing dataset of labeled depth images of the human hand and simulated depth images of a robotic hand. The final training set includes 400K pairwise depth images and joint angles of a Shadow C6 robotic hand. The network evaluation results verify the superiority of TeachNet, especially regarding the high-precision condition. Imitation experiments and grasp tasks teleoperated by novice users demonstrate that TeachNet is more reliable and faster than the state-of-the-art vision-based teleoperation method.

연구 동기 및 목표

  • 인간 손의 깊이 영상만을 사용하여 다지털 로봇 손의 직관적이고 마커가 없는 원격 조작을 가능하게 하기 위해.
  • 해부학적 및 시각적으로 다를 수 있는 인간 손과 로봇 손 간의 매핑을 엔드 투 엔드 방식으로 해결하기 위해.
  • 중간 단계의 자세 추정이나 후처리에 의존하는 것을 줄이고, 입력 깊이 영상에서 직접적으로 로봇 관절 각도를 회귀함으로써 이를 달성하기 위해.
  • 강력한 시각 기반 원격 조작 시스템을 훈련하기 위한 대규모이고 동기화된 인간-로봇 데이터셋을 구축하기 위해.
  • 초보자 운용자의 사용성 향상을 위해 抓握 작업의 시간과 오류를 최소화하기 위해.

제안 방법

  • 인간 손 깊이 영상에서 로봇 관절 각도로의 직접적인 운동학적 매핑을 학습하는 교사-학생 신경망 아키텍처인 TeachNet의 설계.
  • 실제 인간 손의 깊이 영상과 해당 자세에서 시뮬레이션된 샤로우 손의 깊이 영상이 결합된 400만 건의 데이터셋 구축.
  • 로봇 손의 카르테시안 위치와 링크 방향을 인간 손 자세와 일치시키기 위해 일관성 손실 함수를 사용하여 해부학적 차이에 대한 일반화 능력을 향상시킴.
  • 자기 충돌 제약 조건을 고려하면서 인간 손의 관절 관점 및 링크 방향을 기반으로 로봇 관절 각도를 추정하는 최적화된 매핑 방법 구현.
  • 중간 단계의 자세 추정 없이, 쌍으로 구성된 깊이 영상과 진짜 로봇 관절 각도를 사용하여 엔드 투 엔드 방식으로 네트워크 훈련.
  • 훈련된 모델을 실시간 원격 조작에 구현하여, 인간 운영자로부터의 실시간 깊이 입력이 직접적으로 로봇 관절 명령으로 매핑됨.

실험 결과

연구 질문

  • RQ1명시적인 자세 추정 없이도 엔드 투 엔드 딥 네트워크가 인간 손 깊이 영상에서 로봇 손 관절 각도로 정확하고 강건한 매핑을 학습할 수 있는가?
  • RQ2제안된 일관성 손실이 인간 손과 로봇 손 간의 해부학적 및 외관적 차이를 다루는 데 얼마나 효과적인가?
  • RQ3기존 최고 수준의 데이터 기반 방법들과 비교해 본다면, 제안된 방법이 초보자 사용자의 원격 조작 속도와 정확도를 어느 정도 향상시키는가?
  • RQ4부족한 조명 조건이나 가림 현상이 발생할 경우 성능이 어떻게 저하되는가?
  • RQ5다양한 형태와 크기의 물체를 포함한 복잡한 抓握 작업에 대해 이 방법이 일반화 가능한가?

주요 결과

  • TeachNet은 다른 엔드 투 엔드 기반 모델들과 비교해 특히 고정밀 조건에서 더 높은 정확도와 낮은 오차를 기록했다.
  • 초보자 사용자들은 TeachNet을 사용할 경우 손 안에서 물체를 잡고 놓는 작업을 평균 20.73초 만에 완료했고, HandIK 기반 기준 대비 44% 더 빠르게 수행했다(HandIK: 36.39초).
  • 큰 지름을 가진 물체(예: botle, 머그컵)를 다루는 작업에서 HandIK는 엄지의 정확도가 낮아지면서 지연이 발생했지만, 본 방법은 이에 비해 뚜렷하게 뛰어난 성능을 보였다.
  • 가장 오래 소요된 작업은 바나나를 다루는 것이었으며, 이는 길고 좁은 형태로 손끝 제어가 정밀하게 요구되어 25.80초가 소요되었다.
  • 주로 손가락의 두 번째 및 세 번째 관절, 그리고 엄지의 기저 관절에서 오류가 발생했으며, 이는 샤로우 손의 복잡한 운동학적 특성과 가림 현상 때문일 가능성이 높다.
  • 고정된 손목 관절을 가진 로봇에서도 명시적인 관절 대응 관계 정의 없이도 시스템은 인간의 제스처를 신뢰성 있게 실시간으로 모방하는 데 성공했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.