Skip to main content
QUICK REVIEW

[논문 리뷰] Multi-View Spatial-Temporal Network for Continuous Sign Language Recognition

Ronghui Li, Lu Meng|arXiv (Cornell University)|2022. 04. 19.
Hand Gesture Recognition Systems인용 수 8
한 줄 요약

이 논문은 RGB 및 뼈대 모odalities를 융합하기 위해 새로운 Attention-enhanced Multi-scale 3D Graph Convolutional Network (AM3D-GCN)과 Transformer 기반 인코더를 사용하는 다중 시점 공간-시간 네트워크(MSTCSLRN)를 제안한다. 이는 장거리 의존성을 모델링하며, 연속된 수어 인식에서 1.9%의 단어 오류율(WER)을 달성하여 SLR-100에서, 22.8%의 WER를 달성하여 RWTH-PHOENIX-Weather에서 최신 기술을 초월한다.

ABSTRACT

Sign language is a beautiful visual language and is also the primary language used by speaking and hearing-impaired people. However, sign language has many complex expressions, which are difficult for the public to understand and master. Sign language recognition algorithms will significantly facilitate communication between hearing-impaired people and normal people. Traditional continuous sign language recognition often uses a sequence learning method based on Convolutional Neural Network (CNN) and Long Short-Term Memory Network (LSTM). These methods can only learn spatial and temporal features separately, which cannot learn the complex spatial-temporal features of sign language. LSTM is also difficult to learn long-term dependencies. To alleviate these problems, this paper proposes a multi-view spatial-temporal continuous sign language recognition network. The network consists of three parts. The first part is a Multi-View Spatial-Temporal Feature Extractor Network (MSTN), which can directly extract the spatial-temporal features of RGB and skeleton data; the second is a sign language encoder network based on Transformer, which can learn long-term dependencies; the third is a Connectionist Temporal Classification (CTC) decoder network, which is used to predict the whole meaning of the continuous sign language. Our algorithm is tested on two public sign language datasets SLR-100 and PHOENIX-Weather 2014T (RWTH). As a result, our method achieves excellent performance on both datasets. The word error rate on the SLR-100 dataset is 1.9%, and the word error rate on the RWTHPHOENIX-Weather dataset is 22.8%.

연구 동기 및 목표

  • 명확한 단어 경계가 없는 연속된 수어 시퀀스를 인식하는 도전 과제를 해결하기 위해 약한 지도 학습 기반의 시퀀스-투-시퀀스 모델링이 필요하다.
  • 기존의 CNN-LSTM 모델이 공간적 및 시간적 특징을 별도로 학습하고 장기 의존성에 취약하여 발생하는 한계를 극복한다.
  • RGB 영상 프레임과 뼈대 관절 키포인트 데이터 간의 상보적인 정보 융합을 통해 인식의 강인성을 향상시킨다.
  • 두 모달리티에서 공간-시간 역학을 동시에 모델링할 수 있는 특징 추출 네트워크를 설계하여 표현 학습을 향상시킨다.
  • 통합된 다중 모달 학습 및 주의 메커니즘을 통해 공개된 연속 수어 데이터셋에서 최신 기술 성능을 달성한다.

제안 방법

  • 장기간 수어 시퀀스를 더 짧은 클립으로 분할하기 위해 슬라이딩 윈도우 전략을 사용하여 공간-시간 특징 학습을 더욱 효과적으로 한다.
  • 전역적인 운동 및 외관 패턴을 캡처하기 위해 RGB 영상 클립에서 공간-시간 특징을 추출하기 위해 비전 트랜스포머(ViT)를 사용한다.
  • 뼈대 시퀀스의 관절 좌표와 그 관계를 시간에 따라 모델링하기 위해 Attention-enhanced Multi-scale 3D Graph Convolutional Network(AM3D-GCN)을 설계한다.
  • AM3D-GCN에 다중 척도 수신장(field)을 통합하여 먼 관절 간의 장거리 의존성을 캡처하고 구조적 모델링을 향상시킨다.
  • AM3D-GCN에 공간-시간 주의 메커니즘을 적용하여 정확도가 떨어지는 관절 예측에서 유발되는 노이즈를 억제하고 강인성을 향상시킨다.
  • 수어 시퀀스의 장기 시간 의존성을 모델링하기 위해 RNN의 한계를 극복하기 위해 트랜스포머 기반 인코더를 사용한다.
  • 암시적 시간 분류(Connectionist Temporal Classification, CTC) 디코더를 구현하여 인코딩된 특징에서 최종 수어 단어 시퀀스를 예측한다.

실험 결과

연구 질문

  • RQ1RGB 및 뼈대 모달리티를 함께 모델링하면 연속 수어 인식의 성능 향상에 기여하는가?
  • RQ2표준 2D 또는 3D-GCN에 비해 다중 척도 3D-GCN 아키텍처가 신체 관절 간의 공간-시간 관계 모델링에 얼마나 기여하는가?
  • RQ3특징 추출기 내 공간-시간 주의 메커니즘을 통합함으로써 노이즈가 많은 관절 예측에 대한 민감도는 어느 정도 감소하는가?
  • RQ4트랜스포머 기반 인코더는 RNN 기반 인코더보다 연속 수어 시퀀스의 장기 의존성을 더 잘 포착할 수 있는가?
  • RQ5SLR-100 및 RWTH-PHOENIX-Weather와 같은 표준 벤치마크에서 제안된 다중 시점 공간-시간 네트워크는 최신 기술 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • 제안된 방법은 SLR-100 데이터셋에서 1.9%의 단어 오류율(WER)을 달성하여 비교된 모든 방법 중 1위를 기록하였다.
  • RWTH-PHOENIX-Weather 데이터셋에서 22.8%의 WER를 기록하여, 낮은 영상 품질에도 불구하고 강력한 일반화 능력을 입증하였다.
  • RGB 및 뼈대 데이터 융합으로 인해 WER가 RGB 전용일 경우 3.2%, 뼈대 전용일 경우 2.1%에서 다중 모달 융합일 경우 1.9%로 감소하여 상보적 모달리티 학습의 유용성을 확인하였다.
  • 제거 분석 결과, 3D-GCN에 다중 척도 및 공간-시간 주의 메커니즘을 통합한 경우 WER가 2D-GCN 전용일 경우 3.6%에서 2.1%로 감소하여 AM3D-GCN 설계의 효과성을 입증하였다.
  • 트랜스포머 기반 인코더는 장기간 시퀀스 모델링에서 뛰어난 성능을 보였으며, 수백 프레임에 걸친 의존성을 포착하는 데서 RNN 기반 대안보다 뛰어났다.
  • 다중 척도 아키텍처를 가진 AM3D-GCN는 모든 변종 중에서 가장 높은 성능(WER = 2.1%)을 기록하여 장거리 관절 관계 모델링의 중요성을 강조하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.