Skip to main content
QUICK REVIEW

[논문 리뷰] Large-scale Isolated Gesture Recognition Using Convolutional Neural Networks

Pichao Wang, Wanqing Li|arXiv (Cornell University)|2017. 01. 07.
Hand Gesture Recognition Systems참고 문헌 32인용 수 5
한 줄 요약

이 논문은 깊이 시퀀스를 사용하여 대규모 고립된 제스처 인식을 위한 세 가지 컴act한 이미지 기반 표현 방식—동적 깊이 이미지(Dynamic Depth Images, DDI), 동적 깊이 노멀 이미지(Dynamic Depth Normal Images, DDNI), 동적 깊이 모션 노멀 이미지(Dynamic Depth Motion Normal Images, DDMNI)—을 제안한다. 순차적인 깊이 지도를 이중 방향 순위 풀링을 적용하여 시공간 이미지로 변환함으로써, 이 방법은 깊이 데이터만을 사용하여 사전 훈련된 컨볼루션 네트워크(ConvNets)의 미세조정을 가능하게 하여, 55.57%의 정확도를 달성하고 ChaLearn LAP 2016 경연에서 2위를 기록하였다. 이는 오직 깊이 모odal리티만을 사용한 것으로도 높은 성능을 달성했음을 시사한다.

ABSTRACT

This paper proposes three simple, compact yet effective representations of depth sequences, referred to respectively as Dynamic Depth Images (DDI), Dynamic Depth Normal Images (DDNI) and Dynamic Depth Motion Normal Images (DDMNI). These dynamic images are constructed from a sequence of depth maps using bidirectional rank pooling to effectively capture the spatial-temporal information. Such image-based representations enable us to fine-tune the existing ConvNets models trained on image data for classification of depth sequences, without introducing large parameters to learn. Upon the proposed representations, a convolutional Neural networks (ConvNets) based method is developed for gesture recognition and evaluated on the Large-scale Isolated Gesture Recognition at the ChaLearn Looking at People (LAP) challenge 2016. The method achieved 55.57\% classification accuracy and ranked $2^{nd}$ place in this challenge but was very close to the best performance even though we only used depth data.

연구 동기 및 목표

  • 제한된 훈련 데이터로 깊이 시퀀스에서 고립된 제스처를 인식하는 데 도전하는 데 목적이 있다.
  • 공간-시간 역학을 유지하는 컴팩트하고 효과적인 깊이 시퀀스의 이미지 유사 표현을 개발하는 데 목적이 있다.
  • 큰 네트워크를 처음부터 훈련시키지 않고도 이미지 기반 컨볼루션 네트워크에서 깊이 시퀀스 분류로의 전이 학습을 가능하게 하는 데 목적이 있다.
  • RGB 또는 다중 모odal 입력에 의존하지 않고 오직 깊이 데이터만을 사용하여 대규모 제스처 인식에서 높은 정확도를 달성하는 데 목적이 있다.

제안 방법

  • 시퀀스 내 깊이 지도의 단순 평균인 동적 깊이 이미지(Dynamic Depth Images, DDI)를 제안하여 전체 자세를 캡처한다.
  • 깊이 지도에 이중 방향 순위 풀링을 적용하여 공간적 및 시간적 특징을 인코딩한 동적 깊이 노멀 이미지(Dynamic Depth Normal Images, DDNI)를 도입한다.
  • 연속된 깊이 지도 간의 차이에 대해 이중 방향 순위 풀링을 적용하여 운동 역학을 강조한 동적 깊이 모션 노멀 이미지(Dynamic Depth Motion Normal Images, DDMNI)를 개발한다.
  • 시간과 공간을 아우르는 특징을 집계하기 위해 이중 방향 순위 풀링을 사용하여 깊이 시퀀스에서 컴팩트하고 구분력 있는 이미지 표현을 생성한다.
  • 추가적인 큰 수의 새로운 파rameter를 추가하지 않고도 구축된 이미지 표현에 대해 사전 훈련된 컨볼루션 네트워크 모델(예: AlexNet)의 미세조정을 수행한다.
  • 표준 컨볼루션 네트워크 아키텍처를 이미지 유사 표현에 적용하여 깊이 시퀀스 데이터에 대한 효율적인 훈련과 추론을 가능하게 한다.

실험 결과

연구 질문

  • RQ1컴팩트하고 이미지 기반의 표현 방식은 제스처 인식을 위한 깊이 시퀀스에서 공간적 자세와 시간적 운동을 효과적으로 캡처할 수 있는가?
  • RQ2이러한 이미지 표현에 대해 사전 훈련된 컨볼루션 네트워크를 미세조정할 경우, 수작업 특징 추출 방법에 비해 대규모 제스처 인식에서 얼마나 뛰어난 성능을 보일 수 있는가?
  • RQ3다중 모달 접근 방식에 비해 오직 깊이 데이터만을 사용할 경우, 대규모 고립된 제스처 인식에서 성능는 어떻게 비교되는가?
  • RQ4이중 방향 순위 풀링은 깊이 시퀀스의 시공간 역학을 효과적으로 포착하여 인식 정확도 향상에 기여할 수 있는가?

주요 결과

  • 제안된 방법은 ChaLearn LAP 2016 경연의 테스트 세트에서 55.57%의 인식 정확도를 달성하여 종합 2위를 기록하였다.
  • 오직 깊이 데이터만을 사용했음에도 불구하고, 이 방법의 성능는 우승 팀(56.90%)이 깊이와 RGB 모달리티를 모두 사용한 것과 매우 유사한 성능을 보였다(55.57% 대비 56.90%).
  • 이 방법은 테스트 세트에서 MFSK(24.19%) 및 MFSK+DeepID(23.67%)와 같은 베이스라인 방법에 비해 뚜렷이 뛰어난 성능을 보였다.
  • DDI, DDNI, 및 DDMNI 세 가지 표현 방식은 상호보완적이며, 개별적으로 사용하는 것보다 함께 사용할 경우 더 높은 인식 정확도 향상을 이끌어냈다.
  • 제안된 이미지 표현에 대해 사전 훈련된 컨볼루션 네트워크를 미세조정한 방식은 제한된 훈련 데이터(평균 약 144개 클립/클래스)에서도 효과적인 학습을 가능하게 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.