Skip to main content
QUICK REVIEW

[논문 리뷰] SLGTformer: An Attention-Based Approach to Sign Language Recognition

Neil Song, Xiang Yu|arXiv (Cornell University)|2022. 12. 21.
Hand Gesture Recognition Systems인용 수 4
한 줄 요약

SLGTformer는 인간의 뼈대 관절 키포인트 시퀀스를 사용하여 비앙샘블, 주목성 기반 트랜스포머 모델을 제안한다. 공간 모델링을 위해 학습 가능한 그래프 상대적 위치 인코딩(LGRPE)을 결합하고, 효율적인 국소-전역 시간 모델링을 위해 시간 이중 자기주도 주목성(TTSA)을 사용하여 앙상블 없이 WLASL2000 데이터셋에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Sign language is the preferred method of communication of deaf or mute people, but similar to any language, it is difficult to learn and represents a significant barrier for those who are hard of hearing or unable to speak. A person's entire frontal appearance dictates and conveys specific meaning. However, this frontal appearance can be quantified as a temporal sequence of human body pose, leading to Sign Language Recognition through the learning of spatiotemporal dynamics of skeleton keypoints. We propose a novel, attention-based approach to Sign Language Recognition exclusively built upon decoupled graph and temporal self-attention: the Sign Language Graph Time Transformer (SLGTformer). SLGTformer first deconstructs spatiotemporal pose sequences separately into spatial graphs and temporal windows. SLGTformer then leverages novel Learnable Graph Relative Positional Encodings (LGRPE) to guide spatial self-attention with the graph neighborhood context of the human skeleton. By modeling the temporal dimension as intra- and inter-window dynamics, we introduce Temporal Twin Self-Attention (TTSA) as the combination of locally-grouped temporal attention (LTA) and global sub-sampled temporal attention (GSTA). We demonstrate the effectiveness of SLGTformer on the World-Level American Sign Language (WLASL) dataset, achieving state-of-the-art performance with an ensemble-free approach on the keypoint modality. The code is available at https://github.com/neilsong/slt

연구 동기 및 목표

  • 고립된 수기 언어 인식을 위한 강력한 주목성 기반 트랜스포머 프레임워크를 개발한다.
  • 학습 가능한 그래프 상대적 위치 인코딩(LGRPE)을 통해 그래프 이웃 구조를 통합하여 공간 모델링을 향상시킨다.
  • 국소 및 전역 주목성 메커니즘의 조합을 통해 효율적인 장거리 및 단거리 의존성 학습을 위한 시간 모델링을 향상시킨다.
  • 앙상블 없이 RGB 모odal리티에 의존하지 않고 WLASL2000 데이터셋에서 최신 기술 수준의 성능을 달성한다.
  • 관찰 제한 및 서머너 실행의 변동성과 같은 키포인트 기반 수기 언어 인식(SLR)의 한계를 개선된 주목성 메커니즘을 통해 해결한다.

제안 방법

  • SLGTformer는 공간 그래프와 시간 윈도우를 분리하여 독립적인 주목성 계산을 수행함으로써 시공간 키포인트 시퀀스를 처리한다.
  • 공간 자기주도 주목성에 구조적 이웃 구조를 통합하기 위해 학습 가능한 그래프 상대적 위치 인코딩(LGRPE)을 도입하여 노드 수준의 표현 학습을 향상시킨다.
  • 시간 이중 자기주도 주목성(TTSA) 메커니즘은 국소 그룹화 시간 주목성(LTA)을 통해 단거리 역학을, 전역 샘플링 시간 주목성(GSTA)을 통해 장거리 의존성을 결합한다.
  • LGRPE는 공간 주목성에 도움을 주기 위해 자기주도 주목성 이전에 적용되며, 주목성 이후 그래프 컨볼루션을 통해 노드 표현을 추가로 정밀화한다.
  • 모델은 RGB 영상에서 27개 노드의 2차원 키포인트 시퀀스를 추출하기 위해 사전 학습된 전신 자세 추정기(HRNet 기반 MMPose)를 사용하며, 정규화 및 데이터 증강 기법을 적용한다.
  • 일반적인 자기주도 주목성의 제곱 비용을 피하기 위해 윈도우 기반 및 서브샘플링 주목성을 사용하여 모델 복잡도를 감소시킨다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 아키텍처가 키포인트 시퀀스만을 사용하여 고립된 수기 언어 인식에서 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2학습 가능한 그래프 상대적 위치 인코딩(LGRPE)이 인간 뼈대 그래프의 공간 모델링에 얼마나 효과적인가?
  • RQ3국소 및 전역 시간 주목성의 조합(TTSA)이 표준 자기주도 주목성보다 단거리 및 장거리 시간 역학을 더 잘 포괄하는가?
  • RQ4앙성 없는 키포인트 전용 모델이 WLASL2000 벤치마크에서 기존의 앙상블 기반 또는 RGB 기반 방법을 초월할 수 있는가?
  • RQ5데이터 증강 및 키포인트 정규화는 다양한 서머너와 서밍 스타일 간의 일반화에 어떻게 영향을 미치는가?

주요 결과

  • SLGTformer는 WLASL2000 데이터셋에서 앙상블되지 않은 방법 중 최고의 상위 1위 및 상위 5위 정확도를 기록하여 키포인트 전용 모델의 새로운 최신 기술 수준을 설정한다.
  • 제거 실험을 통해 TTSA가 국소 및 장거리 시간 의존성을 효과적으로 모델링함으로써 성능 향상을 크게 이끌어낸다는 것이 확인되었다.
  • 표준 위치 인코딩보다 LGRPE가 성능 향상에 측정 가능한 기여를 하여 그래프 기반 상대적 위치 정보의 가치를 입증한다.
  • 주목성 이후 그래프 컨볼루션은 노드 자기 연결 및 공간적 맥락을 모델링하는 데 특히 성능 향상에 기여한다.
  • 일반적인 자기주도 주목성보다 공간 및 시간 차원 모두에서 성능이 뛰어나, 제안된 아키텍처 구성 요소의 효과성을 입증한다.
  • 사전 학습된 자세 추정기에 의존하고 있음에도 불구하고, 다양한 서머너와 서밍 변형에 대해 잘 일반화되며, 관찰 및 손가락 수준의 정확도 부족은 여전히 도전 과제로 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.