Skip to main content
QUICK REVIEW

[논문 리뷰] Real-time Hand Gesture Detection and Classification Using Convolutional Neural Networks

Okan Köpüklü, Ahmet Gunduz|arXiv (Cornell University)|2019. 01. 29.
Hand Gesture Recognition Systems참고 문헌 24인용 수 10
한 줄 요약

이 논문은 실시간 손동작 인식을 위한 자원 효율적인 두 단계의 CNN 아키텍처를 제안하며, 가벼운 검출기로 동작 활동 기간 동안에만 깊이 있는 분류기 작동을 트리거합니다. EgoGesture에서 91.04%의 Levenshtein 정확도와 nvGesture에서 77.39%의 정확도를 달성했으며, 가중 평균과 신뢰도 기반 단일 시간 활성화를 활용해 최대 9프레임 앞서 검출할 수 있습니다.

ABSTRACT

Real-time recognition of dynamic hand gestures from video streams is a challenging task since (i) there is no indication when a gesture starts and ends in the video, (ii) performed gestures should only be recognized once, and (iii) the entire architecture should be designed considering the memory and power budget. In this work, we address these challenges by proposing a hierarchical structure enabling offline-working convolutional neural network (CNN) architectures to operate online efficiently by using sliding window approach. The proposed architecture consists of two models: (1) A detector which is a lightweight CNN architecture to detect gestures and (2) a classifier which is a deep CNN to classify the detected gestures. In order to evaluate the single-time activations of the detected gestures, we propose to use Levenshtein distance as an evaluation metric since it can measure misclassifications, multiple detections, and missing detections at the same time. We evaluate our architecture on two publicly available datasets - EgoGesture and NVIDIA Dynamic Hand Gesture Datasets - which require temporal detection and classification of the performed hand gestures. ResNeXt-101 model, which is used as a classifier, achieves the state-of-the-art offline classification accuracy of 94.04% and 83.82% for depth modality on EgoGesture and NVIDIA benchmarks, respectively. In real-time detection and classification, we obtain considerable early detections while achieving performances close to offline operation. The codes and pretrained models used in this work are publicly available.

연구 동기 및 목표

  • 낮은 지연, 높은 정확도, 최소한의 전력 소비를 갖춘 실시간 손동작 인식의 과제를 해결하기 위해.
  • 기존 시스템이 실시간 효율성과 자원 제약 조건을 우선시하지 않는 오프라인 정확도에 치중되어 있는 한계를 극복하기 위해.
  • 동적 비디오 스트림에서 중복 또는 누락 검출을 방지하기 위해 각 동작에 대해 단일 시간 활성화를 가능하게 하기 위해.
  • 오분류, 다중 검출, 누락 검출을 동시에 측정할 수 있는 새로운 평가 지표인 Levenshtein 정확도를 도입하기 위해.
  • 신뢰도 기반 활성화와 클래스 점수의 가중 평균을 통해 분류 성능을 훼손하지 않고도 조기 검출을 달성하기 위해.

제안 방법

  • 가벼운 3D CNN 검출기와 고정밀도 분류기(ResNeXt-101)를 조합한 계층적 두 모델 아키텍처를 사용하여 고정밀도 분류를 달성합니다.
  • 실시간 추론을 가능하게 하기 위해 비디오 스트림에 대해 스트라이드가 1인 슬라이딩 윈도우 방식을 적용합니다.
  • 동작 시작 시의 모호성을 줄이고 의사결정의 안정성을 향상시키기 위해 시간에 따라 원시 분류 점수에 가중 평균을 적용합니다.
  • 상위 두 평균 클래스 확률 간의 차이를 기반으로 한 신뢰도 측정을 통해 단일 시간 활성화를 트리거합니다.
  • 검출 및 분류 성능을 종합적으로 평가하기 위해 Levenshtein 거리를 통합 평가 지표로 사용합니다.
  • 검출기가 동작 존재를 신호로 보낼 때에만 고복잡도 분류기를 활성화함으로써 추론을 최적화하여 전력 소비와 메모리 사용량을 감소시킵니다.

실험 결과

연구 질문

  • RQ1고정밀도 오프라인 학습된 CNN을 어떻게 효율적인 실시간 추론에 적응시켜 동적 손동작 인식에 활용할 수 있는가?
  • RQ2실시간 손동작 인식에서 오분류, 다중 검출, 누락 검출의 복합적 과제를 가장 잘 반영하는 평가 지표는 무엇인가?
  • RQ3분류 점수의 가중 평균화가 의사결정 안정성을 향상시키고 조기 신뢰성 있는 손동작 검출을 가능하게 할 수 있는가?
  • RQ4실시간 시스템에서 분류 정확도를 훼손하지 않고 조기 검출을 어느 정도 달성할 수 있는가?
  • RQ5스트리밍 비디오 환경에서 각 동작에 대해 단일 시간 활성화를 신뢰성 있게 구현할 수 있는가?

주요 결과

  • 제안된 시스템은 실시간 평가에서 EgoGesture 데이터셋에서 91.04%의 Levenshtein 정확도, nvGesture 데이터셋에서 77.39%의 정확도를 달성합니다.
  • EgoGesture에서 탐지 임계값 τ_early = 0.4를 설정했을 때, 평균 9프레임의 조기 검출이 가능했으며, Levenshtein 정확도는 단지 1.71% 감소했습니다.
  • 깊이 모odal이 RGB 모달보다 우수했으며, 8프레임 입력을 사용할 경우 nvGesture에서 검출기가 97.30%의 정확도를 달성했습니다.
  • 분류기(ResNeXt-101)는 EgoGesture(깊이 모달)에서 94.04%의 최신 기준 오프라인 정확도와 nvGesture에서 83.82%의 정확도를 기록했습니다.
  • 단일 NVIDIA Titan Xp GPU에서 시스템은 대기 시 460 fps로 작동하고, 동작 처리 시 ResNeXt-101을 사용하면 62 fps, C3D를 사용하면 41 fps로 작동합니다.
  • 낮은 임계값에서 가중 평균화가 균일 평균화보다 조기 검출 성능에서 뚜렷한 우월성을 보였습니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.