[논문 리뷰] Skeleton-based Gesture Recognition Using Several Fully Connected Layers with Path Signature Features and Temporal Transformer Module
이 논문은 경로 서명 특징(S_PS, T_PS, T_S_PS)과 시간적 트랜스포머 모듈(TTM)을 사용한 스켈레톤 기반 제스처 인식 프레임워크를 제안한다. 공간-시간 역학을 모델링하기 위해 손에 초점을 맞춘 'attention on hand' 원칙을 적용하고, 특징 추출을 위해 이항 방법을 사용함으로써, 최소한의 완전 연결 층과 높은 계산 효율성을 확보하면서 ChaLearn 2013, ChaLearn 2016, MSRC-12에서 최신 기술 수준(SOTA)의 정확도를 달성한다.
The skeleton based gesture recognition is gaining more popularity due to its wide possible applications. The key issues are how to extract discriminative features and how to design the classification model. In this paper, we first leverage a robust feature descriptor, path signature (PS), and propose three PS features to explicitly represent the spatial and temporal motion characteristics, i.e., spatial PS (S_PS), temporal PS (T_PS) and temporal spatial PS (T_S_PS). Considering the significance of fine hand movements in the gesture, we propose an "attention on hand" (AOH) principle to define joint pairs for the S_PS and select single joint for the T_PS. In addition, the dyadic method is employed to extract the T_PS and T_S_PS features that encode global and local temporal dynamics in the motion. Secondly, without the recurrent strategy, the classification model still faces challenges on temporal variation among different sequences. We propose a new temporal transformer module (TTM) that can match the sequence key frames by learning the temporal shifting parameter for each input. This is a learning-based module that can be included into standard neural network architecture. Finally, we design a multi-stream fully connected layer based network to treat spatial and temporal features separately and fused them together for the final result. We have tested our method on three benchmark gesture datasets, i.e., ChaLearn 2016, ChaLearn 2013 and MSRC-12. Experimental results demonstrate that we achieve the state-of-the-art performance on skeleton-based gesture recognition with high computational efficiency.
연구 동기 및 목표
- 스켈레톤 기반 제스처 인식에서 특히 미세한 손 움직임에 대해 분류 가능한 특징 추출의 과제를 해결하기 위해.
- 재귀 신경망을 사용하지 않고도 시간적 의존성을 포착할 수 있는 경량이고 효율적인 분류 모델을 설계하기 위해.
- 경로 서명 특징을 사용하여 제스처 시퀀스의 전역적이고 국소적인 시간적 역학을 명시적으로 모델링하기 위해.
- 관절 선택 전략과 엔드 투 엔드로 학습 가능한 시간 정렬을 통해 인식의 강인성과 효율성을 향상시키기 위해.
제안 방법
- 공간 PS(S_PS), 시간 PS(T_PS), 시간-공간 PS(T_S_PS)의 세 가지 경로 서명 특징을 도입하여 공간적 구성과 시간적 역학을 인코딩한다.
- S_PS의 경우 관련 관절 쌍을, T_PS의 경우 단일 관절을 선택하기 위해 '손에 초점을 맞춘(attention on hand, AOH)' 원칙을 제안함으로써 특징의 밀도와 강인성을 향상시킨다.
- T_PS와 T_S_PS 특징을 추출하기 위해 이항 방법을 활용하여 차원 수를 감소시키면서도 전역적이고 국소적인 시간적 역학을 모두 인코딩할 수 있도록 한다.
- 특정 시퀀스에 맞는 시간 이동 파rameter를 학습하는 시간적 트랜스포머 모듈(TTM)을 설계하여, 기울기 기반의 엔드 투 엔드 방식으로 시간 모델링을 향상시킨다.
- 공간적 특징과 시간적 특징을 별도로 처리한 후 초기 융합을 수행하는 다중 스트림 완전 연결 네트워크를 구성함으로써 모델 복잡도를 최소화한다.
- TTM과 경로 서명 특징을 표준 신경망 아키텍처에 통합하여 플러그 앤 플레이 방식의 구현을 가능하게 한다.
실험 결과
연구 질문
- RQ1경로 서명 특징은 스켈레톤 기반 제스처 시퀀스에서 공간적 및 시간적 역학을 효과적으로 포착할 수 있는가?
- RQ2'손에 초점을 맞춘' 원칙이 미세한 손 제스처에 대해 특징의 밀도와 인식 정확도를 어떻게 향상시키는가?
- RQ3학습 가능한 시간 변환 모듈(TTM)이 고정 또는 재귀적 시간 모델링보다 제스처 인식에서 뛰어난 성능을 내는가?
- RQ4다중 스트림 특징 처리를 갖는 단순한 완전 연결 네트워크가 어느 정도까지 최신 기술 수준의 성능을 달성할 수 있는가?
주요 결과
- 제안된 방법은 ChaLearn 2013에서 92.08%의 정확도를 달성하여 이전의 스켈레톤 기반 방법을 초월하고 영상 기반 모델에 가까운 성능을 보였다.
- ChaLearn 2016에서 모델은 39.95%의 정확도를 기록하여 기존의 스켈레톤 기반 방법보다 약 4.5%포인트 높은 성능을 보였다.
- MSRC-12에서 모델은 99.01%의 정확도를 달성하여 스켈레톤 기반 제스처 인식 분야에서 새로운 최신 기술 수준 결과를 수립했다.
- 모델은 단지 269만 개의 곱셈-덧셈 연산(FLOPs)만을 요구하여 RNN 및 CNN 기반 모델보다 현저히 낮은 계산 복잡도를 보이며 높은 계산 효율성을 입증했다.
- 제거 실험을 통해 AOH 원칙과 TTM 모듈이 성능 향상에 기여하는 것으로 확인되었다.
- 모델 복잡도가 제한된 상황에서도 높은 성능을 유지함으로써 명시적 특징 공학과 경량 아키텍처의 효과성을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.