Skip to main content
QUICK REVIEW

[논문 리뷰] Hand Segmentation and Fingertip Tracking from Depth Camera Images Using Deep Convolutional Neural Network and Multi-task SegNet

Hai-Duong Nguyen, Do, Tai Nhu|arXiv (Cornell University)|2019. 01. 11.
Hand Gesture Recognition Systems참고 문헌 17인용 수 6
한 줄 요약

이 논문은 RGB-D 이미지와 다중 작업 SegNet 아키텍처를 사용하여 실시간, 종단 간(end-to-end) 手 분할 및 손가락 끝 검출을 위한 시스템을 제안한다. YOLOv2를 활용해 손 감지를 수행하고, 경량이며 공유형 인코더를 갖춘 SegNet을 통해 동시에 손 구성 요소 분할과 손가락 끝 위치 추정을 수행함으로써, 사용자 캘리브레이션 없이도 1.0 cm 오차 기준에서 83% 정밀도를 달성하며 GPU에서 15 fps의 추론 속도를 확보하였다. 이는 다중 손 및 부분적 가림 상황에서도 잘 작동한다.

ABSTRACT

Hand segmentation and fingertip detection play an indispensable role in hand gesture-based human-machine interaction systems. In this study, we propose a method to discriminate hand components and to locate fingertips in RGB-D images. The system consists of three main steps: hand detection using RGB images providing regions which are considered as promising areas for further processing, hand segmentation, and fingertip detection using depth image and our modified SegNet, a single lightweight architecture that can process two independent tasks at the same time. The experimental results show that our system is a promising method for hand segmentation and fingertip detection which achieves a comparable performance while model complexity is suitable for real-time applications.

연구 동기 및 목표

  • 다양하고 제약이 없는 환경에서 손 분할 및 손가락 끝 검출을 위한 강건하고 실시간 시스템을 개발하기 위해.
  • 기존 방법에서 일반적으로 요구되던 사용자 맞춤형 캘리브레이션 단계를 제거하기 위해.
  • 깊이 기반 제스처 인식에서 배경 변화, 국소적 가림, 다중 손 상황 등의 과제를 해결하기 위해.
  • 두 개의 세분화 작업을 동시에 수행하는 경량 단일 모델 아키텍처를 설계하기 위해.
  • 실제 인간-기계 상호작용 시스템에 구현하기 위해 높은 정확도와 낮은 계산 비용을 균형 잡기 위해.

제안 방법

  • 시스템은 RGB 이미지에서 손 바운딩 박스를 감지하기 위해 YOLOv2를 사용하며, 이를 바탕으로 이후 처리를 위한 해당 깊이 영역을 추출한다.
  • 카메라에 가까운 거리 기반으로 깊이 임계값을 적용하여 깊이 이미지에서 손 영역을 분리한다.
  • 공통 인코더를 공유하고 손 구성 요소 분할과 손가락 끝 검출을 위한 별도 디코더를 갖춘 다중 작업 SegNet 아키텍처를 제안한다.
  • 공통 인코더를 통해 깊이 데이터에서 일반적인 손 표현을 학습하고, 작업별 특화된 디코더는 초기 상태에서부터 학습한다.
  • 과적합 방지를 위해 정규화, 회전, 스케일링, 반사 등의 데이터 증강 기법을 적용하여 강건성을 향상시킨다.
  • 두 개의 별도 SegNet을 훈련하는 것과 비교해 모델 파라미터를 10,014,563개 감소시켰으며, 경쟁 가능한 성능을 유지한다.

실험 결과

연구 질문

  • RQ1단일 경량 딥 러닝 아키텍처가 깊이 이미지에서 손 구성 요소 분할과 손가락 끝 검출을 동시에 효과적으로 수행할 수 있는가?
  • RQ2기존의 단일 작업 또는 이중 모델 접근법과 비교해 본다면, 제안된 다중 작업 SegNet은 정확도와 속도 측면에서 어떻게 성능을 내는가?
  • RQ3사용자 캘리브레이션 또는 배경 가정 없이 다양한 환경에 대해 얼마나 잘 일반화되는가?
  • RQ4국소적 가림 및 다중 손 상황을 얼마나 잘 처리하는가?
  • RQ5실시간 제스처 인식에서 모델 복잡도, 추론 속도, 검출 정확도 사이의 상충 관계는 어떠한가?

주요 결과

  • 제안된 다중 작업 SegNet은 HandNet 데이터셋에서 엄지 검출에 대해 1.0 cm 오차 기준 83% 정밀도를 달성하여 두 기준 모델(76% 및 81%)을 초월한다.
  • GeForce GTX 1080에서 약 15 fps로 실행되어 실시간 인간-기계 상호작용 응용에 적합하다.
  • 손 분할은 30 fps로 실행되어 분할 작업에 있어 높은 효율성을 보여준다.
  • FingerPaint 데이터셋에서 Sharp 등과 Tan 등이 제시한 이전 연구들보다 성능이 뛰어나며, 특히 높은 오차 기준에서 두드러진다.
  • 사용자 맞춤형 캘리브레이션 없이도 국소적 가림 및 다중 손 상황을 성공적으로 처리한다.
  • 두 개의 별도 SegNet을 훈련하는 것과 비교해 모델 파라미터를 1000만 개 이상 감소시켜 계산 비용을 크게 낮추면서도 경쟁 가능한 정확도를 유지한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.