[논문 리뷰] GestFormer: Multiscale Wavelet Pooling Transformer Network for Dynamic Hand Gesture Recognition
이 논문은 표준 트랜스포머보다 파rameter 수와 MAC 연산 수가 적고, 이차적 어텐션을 다중스케일 웨이블릿 풀링 어텐션(MWPA) 기반 구조와 게이팅 피드포워드 네트워크(GFFN)로 대체하는 자원 효율적인 트랜스포머 기반 모델인 GestFormer을 제안한다. 웨이블릿 변환과 다중스케일 풀링을 활용하여 NVGesture 및 Briareo 데이터셋에서 최신 기술 수준의 정확도를 달성한다.
Transformer model have achieved state-of-the-art results in many applications like NLP, classification, etc. But their exploration in gesture recognition task is still limited. So, we propose a novel GestFormer architecture for dynamic hand gesture recognition. The motivation behind this design is to propose a resource efficient transformer model, since transformers are computationally expensive and very complex. So, we propose to use a pooling based token mixer named PoolFormer, since it uses only pooling layer which is a non-parametric layer instead of quadratic attention. The proposed model also leverages the space-invariant features of the wavelet transform and also the multiscale features are selected using multi-scale pooling. Further, a gated mechanism helps to focus on fine details of the gesture with the contextual information. This enhances the performance of the proposed model compared to the traditional transformer with fewer parameters, when evaluated on dynamic hand gesture datasets, NVidia Dynamic Hand Gesture and Briareo datasets. To prove the efficacy of the proposed model, we have experimented on single as well multimodal inputs such as infrared, normals, depth, optical flow and color images. We have also compared the proposed GestFormer in terms of resource efficiency and number of operations. The source code is available at https://github.com/mallikagarg/GestFormer.
연구 동기 및 목표
- 표준 트랜스포머가 동적 손짓 인식에 있어 높은 계산 비용과 복잡도를 야기하는 문제를 해결하기 위해.
- 어텐션 메커니즘을 비매개변수적 풀링 레이어로 대체하여 모델의 효율성을 향상시키기 위해.
- 웨이블릿 변환과 다중스케일 컨텍스트 모델링을 통해 특징 표현을 향상시키기 위해.
- 다양한 스테이지 간 특징 흐름을 선택적으로 필터링하고 정제하는 게이팅 메커니즘을 개발하기 위해.
- 단일 및 다중모odal 입력에서 뛰어난 성능을 내면서도 파rameter 수와 MAC 연산 수를 최소화하기 위해.
제안 방법
- 기본 모델로 PoolFormer를 사용하여 어텐션을 비매개변수적 평균 풀링 레이어로 대체함으로써 계산 복잡도를 감소시킴.
- 새로운 다중스케일 웨이블릿 풀링 어텐션(MWPA) 메커니즘이 입력 특징을 웨이블릿 공간으로 매핑한 후, 다중스케일 풀링을 적용하여 장거리 특징 학습을 향상시킴.
- 게이팅 피드포워드 네트워크(GFFN)는 트랜스포머 블록 간의 정보 흐름을 제어하여 특징 정제 및 표현을 향상시킴.
- 깊이, RGB, 적외선, 옵티컬 플로우, 표면 정규화 모odal을 대상으로 평가하여 다양한 센서 유형 간의 강건성을 확보함.
- 다중스케일 풀링은 세 가지 다른 필터 크기를 사용하여 다중 해상도에서 계층적인 공간적 특징을 추출함.
- 교차 엔트로피 손실과 AdamW 옵timizer를 사용하여 NVGesture 및 Briareo 데이터셋에서 엔드 투 엔드로 모델을 훈련함.
![Figure 1 : Some samples of depth (first row) and surface normals (last row) from the NVGesture and Briareo dataset.These samples are taken from [ 20 ] .](https://ar5iv.labs.arxiv.org/html/2405.11180/assets/x1.png)
실험 결과
연구 질문
- RQ1비어텐션 기반 트랜스포머 아키텍처가 계산 비용을 줄이며 동적 손짓 인식에서 경쟁적인 성능을 달성할 수 있는가?
- RQ2웨이블릿 변환과 다중스케일 풀링을 통합함으로써 특징 표현이 어떻게 향상되는가?
- RQ3게이팅 피드포워드 메커니즘이 저파rameter 환경에서 특징 정제와 모델 정확도를 향상시키는가?
- RQ4RGB, 깊이, 적외선, 옵티컬 플로우, 정규화 등의 다중모달 융합이 단일모달 입력에 비해 성능에 어떤 영향을 미치는가?
- RQ5다중모달 융합 없이도 경량 모델이 표준 트랜스포머를 초월할 수 있는가?
주요 결과
- NVGesture 데이터셋에서 GestFormer는 RGB, 깊이, 적외선, 옵티컬 플로우, 정규화 등 다섯 가지 모달을 모두 사용해 85.85%의 정확도를 달성하여 기준 트랜스포머를 능가함.
- Briareo 데이터셋에서 GestFormer는 적외선 입력만으로도 98.13%의 정확도를 기록하여, 다중모달 융합 없이도 다른 최신 기술 수준의 방법들을 뛰어넘음.
- 제거 실험 결과, 다중스케일 풀링, 웨이블릿 변환, 게이팅 네트워크 각각이 성능 향상에 점진적으로 기여하였으며, 전체 모델은 NVGesture 깊이 모달에서 80.21%의 정확도를 달성함.
- GestFormer는 단지 24.08만 개의 파라미터와 60.40 GFLOPs(MAC 연산 수)를 사용하여 표준 트랜스포머(24.30만 개 파라미터, 62.92 GFLOPs)보다 약간 적은 자원을 사용함으로써 효율성 향상을 입증함.
- 옵티컬 플로우 입력에서도 기준 트랜스포머보다 뛰어난 성능을 보였으며, 이는 시간적 운동 특징에 대한 강건성을 시사함.
- 단일모달 입력 조건에서도 GestFormer는 다른 최신 기술 수준의 방법들을 능가하였으며, 특히 Briareo 데이터셋에서 적외선 입력만으로도 98.13%의 정확도를 달성함.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.