Skip to main content
QUICK REVIEW

[논문 리뷰] Two-stream Fusion Model for Dynamic Hand Gesture Recognition using 3D-CNN and 2D-CNN Optical Flow guided Motion Template

Debajit Sarma, V. Kavyasree|arXiv (Cornell University)|2020. 07. 17.
Hand Gesture Recognition Systems참고 문헌 26인용 수 10
한 줄 요약

이 논문은 RGB 손동작 영상에서 시공간적 특징을 추출하기 위한 3D-CNN와 광학 흐름을 기반으로 한 운동 패턴 인식을 위한 광학 흐름 유도 운동 템플릿(OFMT)을 융합하는 이중 스트림 융합 모델을 제안한다. Graffiti 데이터셋에서 99.20%의 정확도와 내부 데이터셋에서 99%의 정확도를 달성하여 수동 분할이 필요 없고 계산 비용도 감소된 상태에서 최신 기술 수준의 성능을 입증한다.

ABSTRACT

The use of hand gestures can be a useful tool for many applications in the human-computer interaction community. In a broad range of areas hand gesture techniques can be applied specifically in sign language recognition, robotic surgery, etc. In the process of hand gesture recognition, proper detection, and tracking of the moving hand become challenging due to the varied shape and size of the hand. Here the objective is to track the movement of the hand irrespective of the shape, size, and color of the hand. And, for this, a motion template guided by optical flow (OFMT) is proposed. OFMT is a compact representation of the motion information of a gesture encoded into a single image. In the experimentation, different datasets using bare hand with an open palm, and folded palm wearing green-glove are used, and in both cases, we could generate the OFMT images with equal precision. Recently, deep network-based techniques have shown impressive improvements as compared to conventional hand-crafted feature-based techniques. Moreover, in the literature, it is seen that the use of different streams with informative input data helps to increase the performance in the recognition accuracy. This work basically proposes a two-stream fusion model for hand gesture recognition and a compact yet efficient motion template based on optical flow. Specifically, the two-stream network consists of two layers: a 3D convolutional neural network (C3D) that takes gesture videos as input and a 2D-CNN that takes OFMT images as input. C3D has shown its efficiency in capturing spatio-temporal information of a video. Whereas OFMT helps to eliminate irrelevant gestures providing additional motion information. Though each stream can work independently, they are combined with a fusion scheme to boost the recognition results. We have shown the efficiency of the proposed two-stream network on two databases.

연구 동기 및 목표

  • 손의 형태, 크기, 색상 변화에 영향을 받지 않는 강건한 동적 손동작 인식 시스템을 개발하기 위해.
  • 광학 흐름을 활용해 압축된 운동 표현을 생성함으로써 수동 분할이 필요 없도록 하기 위해.
  • 3D-CNN에서 추출한 시공간적 특징과 2D-CNN에서 추출한 운동 패턴 특징을 융합하여 인식 정확도를 향상시키기 위해.
  • 3D-CNN/RNN/LSTM과 같은 깊은 아키텍처에 비해 계산 복잡도를 감소시키기 위해 경량 OFMT 표현을 사용하기 위해.
  • 사전에 분할된 손 영역이 필요 없이 기준 데이터셋에서 최신 기술 수준의 성능을 달성하기 위해.

제안 방법

  • 모델은 이중 스트림 아키텍처를 사용한다: 하나의 스트림은 3D-CNN(C3D)를 통해 원본 RGB 손동작 영상에서 시공간적 특징을 추출한다.
  • 두 번째 스트림은 새로운 광학 흐름 유도 운동 템플릿(OFMT)을 처리하며, 이는 광학 흐름과 배경 제거 업데이트 규칙을 사용해 시간적 운동을 단일 2D 이미지로 인코딩한다.
  • OFMT는 광학 흐름에서 유도된 운동 벡터를 누적하여 생성되며, 배경 노이즈는 동적 업데이트 메커니즘을 통해 감소되어 운동 윤곽의 정확도가 향상된다.
  • 두 스트림은 별도로 훈련되며, 최적의 융합 파rameter(γ=0.6, δ=0.4)를 가진 확률적 앙상블 공식을 사용해 의사결정 수준에서 예측 점수를 융합한다.
  • 융합 전략은 3D-CNN이 미세한 시공간적 동역학을 포착하는 능력과 2D-CNN이 OFMT에서 운동 패턴을 효율적으로 인식하는 능력을 조합한다.
  • 프레임워크는 손이 드러나 있는 경우와 초록 장갑을 착용한 경우를 모두 포함한 Graffiti 데이터셋과 내부 데이터셋에서 평가되었으며, 성능 향상을 위해 후기 융합을 사용하였다.

실험 결과

연구 질문

  • RQ1광학 흐름에 의해 유도된 운동 템플릿은 계산 복잡도를 감소시키면서도 인식 정확도를 향상시킬 수 있는가?
  • RQ23D-CNN과 2D-CNN 스트림을 융합하면 개별 모델보다 동적 손동작 인식에서 더 나은 성능을 내는가?
  • RQ3제안된 OFMT 표현은 수동 분할 없이도 배경 노이즈를 효과적으로 억제하고 운동 윤곽을 유지할 수 있는가?
  • RQ4다양한 손동작 데이터셋에서 제안된 이중 스트림 융합 모델은 최신 기술 수준의 방법들과 비교해 정확도와 강건성 측면에서 어떻게 성능을 내는가?
  • RQ5자원 제약 환경에서 시공간적 특징과 운동 패턴 특징을 융합하는 것은 인식 성능 향상에 어느 정도 기여하는가?

주요 결과

  • 제안된 이중 스트림 융합 모델은 Graffiti 데이터셋에서 99.20%의 인식 정확도를 달성하여 비교된 모든 방법들보다 뛰어나며, CNN-CRF 융합 모델의 98.40%보다 높은 성능을 보였다.
  • 3D-CNN 단독 모델은 97.30%의 정확도를 기록했고, 2D-CNN 단독 모델은 92.60%의 정확도를 달성하여 두 스트림이 상호 보완적임을 입증했다.
  • 내부 데이터셋에서는 융합 모델이 99%의 인식 정확도를 달성하여 이전 방법과 동일한 성능를 보였지만, 수동 분할이 필요 없었다.
  • 최적의 융합 파rameter는 γ=0.6과 δ=0.4로 확인되었으며, 이는 3D-CNN에서 유도된 시공간적 특징이 최종 정확도에 더 크게 기여하고 있음을 시사한다.
  • OFMT 표현은 배경 노이즈를 효과적으로 감소시키고 운동 윤곽을 유지하여 장시간이고 다양한 영상 시퀀스에서도 정확한 손동작 검출이 가능하게 하였다.
  • 압축된 OFMT 표현과 경량 2D-CNN 스트림 덕분에 계산 비용이 효율적이며, 자원 제약 환경에서의 구현에 적합한 모델이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.