Skip to main content
QUICK REVIEW

[논문 리뷰] From Hand-Perspective Visual Information to Grasp Type Probabilities: Deep Learning via Ranking Labels

Mo Han, Sezen Yağmur Günay|arXiv (Cornell University)|2021. 03. 08.
Muscle activation and electromyography studies참고 문헌 32인용 수 6
한 줄 요약

이 논문은 손-시각 입력에서 그립 유형의 확률을 예측하기 위한 딥러닝 프레임워크를 제안한다. 이는 순서 기반 레이블을 사용하여 그립 레이블링의 순열 모호성을 다루기 위해 Plackett-Luce 모델을 활용한다. 손-시각 이미지에서 학습하고 수동으로 순서가 매겨진 그립 목록을 지도로 사용함으로써, 로봇 보철의 인간 중심 제어를 위한 확률적 제어를 가능하게 하며, 표준 분류 방법에 비해 일반화 능력이 향상되어 다양한 그립 유형에서 견고한 성능을 달성한다.

ABSTRACT

Limb deficiency severely affects the daily lives of amputees and drives efforts to provide functional robotic prosthetic hands to compensate this deprivation. Convolutional neural network-based computer vision control of the prosthetic hand has received increased attention as a method to replace or complement physiological signals due to its reliability by training visual information to predict the hand gesture. Mounting a camera into the palm of a prosthetic hand is proved to be a promising approach to collect visual data. However, the grasp type labelled from the eye and hand perspective may differ as object shapes are not always symmetric. Thus, to represent this difference in a realistic way, we employed a dataset containing synchronous images from eye- and hand- view, where the hand-perspective images are used for training while the eye-view images are only for manual labelling. Electromyogram (EMG) activity and movement kinematics data from the upper arm are also collected for multi-modal information fusion in future work. Moreover, in order to include human-in-the-loop control and combine the computer vision with physiological signal inputs, instead of making absolute positive or negative predictions, we build a novel probabilistic classifier according to the Plackett-Luce model. To predict the probability distribution over grasps, we exploit the statistical model over label rankings to solve the permutation domain problems via a maximum likelihood estimation, utilizing the manually ranked lists of grasps as a new form of label. We indicate that the proposed model is applicable to the most popular and productive convolutional neural network frameworks.

연구 동기 및 목표

  • 보철 제어를 위한 그립 인식에서 눈-시각과 손-시각 시점 간의 괴리 문제를 해결하기 위해.
  • 그립 선택의 불확실성을 모델링함으로써 인간 중심 제어를 지원하는 확률적 그립 분류 방법을 개발하기 위해.
  • 그립 레이블링의 순열 모호성을 해결하기 위해 순서가 매겨진 그립 목록을 지도로 사용하기 위해.
  • 시각 신호와 생리적 신호(EMG, 운동학)를 융합하여 다중모달 보철 제어를 가능하게 하기 위해.
  • 실제 구현에 적합한 표준 CNN 아키텍처와 호환되는 방법을 설계하기 위해.

제안 방법

  • 이 방법은 손-시각 이미지를 입력으로 사용하여 컨볼루션 신경망을 통해 특징을 추출한다.
  • 눈-시각 이미지에서 수동으로 레이블링된 그립 순서를 새로운 형태의 지도로 활용하여 인간이 그립 가능성에 대해 인식하는 방식을 표현한다.
  • Plackett-Luce 모델을 적용하여 순서 기반 레이블에 기반한 그립 유형에 대한 확률 분포를 모델링하고 최대우도 추정을 가능하게 한다.
  • 프레임워크는 그립 예측 문제를 순서 기반 학습 문제로 변환하여 레이블 순열에 대한 민감도를 감소시킨다.
  • Plackett-Luce 우도에서 유도된 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 모델을 훈련시키며, 기울기 기반 최적화를 허용한다.
  • 이 방법은 ResNet 및 EfficientNet과 같은 인기 있는 CNN 아키텍처와 호환되어 기존의 시각 파ip라인에 통합이 가능하다.

실험 결과

연구 질문

  • RQ1비대칭으로 인해 같은 물체에 대해 눈-시각과 손-시각 시점에서 시각적 차이가 발생할 경우, 그립 예측은 어떻게 향상시킬 수 있는가?
  • RQ2기존의 one-hot 분류에 비해 순서 기반 레이블이 그립 예측의 강인성과 현실성에 기여하는가?
  • RQ3Plackett-Luce 모델을 통해 그립 확률을 모델링할 경우, 다중모달 보철 제어 성능에 얼마나 기여하는가?
  • RQ4시각 입력은 어떻게 EMG 및 운동학 데이터와 효과적으로 융합되어 로봇 손의 하이브리드 제어를 가능하게 하는가?
  • RQ5제안된 방법은 실세계 구현을 위해 표준 딥러닝 프레임워크와 호환되는가?

주요 결과

  • 제안된 방법은 특히 비대칭 또는 모호한 물체 형태에서 기준 분류 모델에 비해 더 높은 정확도를 달성한다.
  • Plackett-Luce 모델을 통한 순서 기반 레이블 사용은 레이블 순열에 대한 민감도를 감소시키고 다양한 그립 유형에 걸쳐 일반화 능력을 향상시킨다.
  • 프레임워크는 인간 중심 제어를 지원하는 확률적 출력을 가능하게 하여 사용자가 확률적으로 높은 그립 목록에서 선택할 수 있도록 한다.
  • 모델은 최신 기술의 CNN 아키텍처와 호환되어 기존의 로봇 시각 파이프라인에 통합이 가능하다.
  • 동기화된 눈-시각 및 손-시각 이미지, EMG 및 운동학 데이터를 포함한 데이터셋은 향후 다중모달 융합 연구를 지원한다.
  • 실세계 조건에서 물체의 대칭성이 보장되지 않는 경우에도 개선된 강인성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.