Skip to main content
QUICK REVIEW

[논문 리뷰] Word-level Sign Language Recognition with Multi-stream Neural Networks Focusing on Local Regions and Skeletal Information

Mizuki Maruyama, Singh, Shrey|arXiv (Cornell University)|2021. 06. 30.
Hand Gesture Recognition Systems참고 문헌 43인용 수 6
한 줄 요약

이 논문은 국소 영역 이미지(손과 얼굴)와 골격 데이터를 통합하여 세부적인 제스처와 공간적 관계를 포착함으로써 I3D 기반 모델을 향상시키는 다중 스트림 신경망(MSNN)을 제안한다. 전반적인, 국소적, 골격 스트림을 후기 평균화된 분류 점수 융합을 통해 융합함으로써 WLASL 데이터셋에서 이전 최고 성능 방법 대비 15%의 Top-1 정확도 향상을 달성하였다.

ABSTRACT

Word-level sign language recognition (WSLR) has attracted attention because it is expected to overcome the communication barrier between people with speech impairment and those who can hear. In the WSLR problem, a method designed for action recognition has achieved the state-of-the-art accuracy. Indeed, it sounds reasonable for an action recognition method to perform well on WSLR because sign language is regarded as an action. However, a careful evaluation of the tasks reveals that the tasks of action recognition and WSLR are inherently different. Hence, in this paper, we propose a novel WSLR method that takes into account information specifically useful for the WSLR problem. We realize it as a multi-stream neural network (MSNN), which consist of three streams: 1) base stream, 2) local image stream, and 3) skeleton stream. Each stream is designed to handle different types of information. The base stream deals with quick and detailed movements of the hands and body, the local image stream focuses on handshapes and facial expressions, and the skeleton stream captures the relative positions of the body and both hands. This approach allows us to combine various types of data for more comprehensive gesture analysis. Experimental results on the WLASL and MS-ASL datasets show the effectiveness of the proposed method; it achieved an improvement of approximately 10\%--15\% in Top-1 accuracy when compared with conventional methods.

연구 동기 및 목표

  • 전반적인 외관 특징을 초월하여 국소 시각적 및 공간적 골격 정보를 통합함으로써 단어 수준의 수어 인식(WSLR) 정확도를 향상시키기 위해.
  • I3D 네트워크가 수어 제스처에서 세부적인 손 모양, 표정, 손-몸 간 공간적 관계를 포착하는 데에 한계가 있음을 해결하기 위해.
  • 전반적, 국소적, 골격 표현을 융합하여 향상된 WSLR 성능을 위한 확장 가능한 다중 스트림 딥 러닝 프레임워크를 설계하기 위해.
  • WLASL 및 MS-ASL를 포함한 여러 데이터셋에서 제안된 방법의 효과성과 일반화 능력을 검증하기 위해.
  • 제스처의 모호성과 변동성과 관련된 WSLR의 핵심 과제를 규명하고 향후 모델의 강력한 분류 능력을 위한 기반을 마련하기 위해.

제안 방법

  • 제안된 MSNN 프레임워크는 세 가지 독립적인 스트림으로 구성된다: 기본 스트림(전반적인 외관 및 옵티컬 플로우), 국소 이미지 스트림(손과 얼굴 영역 자르기), 골격 스트림(3D 자세 데이터에 대한 시공간 그래프 컨볼루션).
  • 기본 스트림은 전체 프레임 RGB 및 옵티컬 플로우 입력에서 시공간 특징을 추출하기 위해 I3D를 사용한다.
  • 국소 이미지 스트림은 손과 얼굴의 자른 비디오 클립에 I3D를 적용하여 손 모양과 표정과 같은 국소 제스처 세부 정보를 강조한다.
  • 골격 스트림은 신체 관절 간의 위치 관계를 모델링하기 위해 ST-GCN을 활용하여 배경 및 외관 변화에 대한 민감도를 감소시킨다.
  • 각 스트림은 별도로 훈련되며, 추론 시에는 세 스트림의 분류 점수를 평균화하여 최종 예측을 얻는다.
  • 프레임워크는 WLASL 및 MS-ASL 데이터셋에서 평가되었으며, 각 스트림의 기여도를 검증하기 위한 추론 분석이 수행되었다.

실험 결과

연구 질문

  • RQ1국소 영역 이미지(손과 얼굴)와 골격 데이터의 통합이 전반적인 외관 특징을 초월하여 단어 수준의 수어 인식 성능을 향상시킬 수 있는가?
  • RQ2대규모 WSLR 데이터셋에서 제안된 다중 스트림 아키텍처는 단일 스트림 I3D 기반 모델 대비 Top-1 정확도에서 어떻게 비교되는가?
  • RQ3국소 시각적 및 골격 스트림이 모호하거나 변동성이 큰 제스처의 경우에 개별적으로 얼마나 성능 향상에 기여하는가?
  • RQ4제안된 방법은 다양한 데이터셋 크기와 어휘 척도에서 높은 성능와 확장성을 유지하는가?
  • RQ5모듈러하고 다중 모odal 설계를 고려할 때, 제안된 프레임워크는 미국 수어 외 다른 수어로 일반화될 수 있는가?

주요 결과

  • 제안된 MSNN는 WLASL100에서 81.38%의 Top-1 정확도, WLASL300에서 73.43%, WLASL1000에서 63.61%, WLASL2000에서 47.26%를 기록하여 기준 I3D 방법 대비 약 15% 향상된 성능을 달성하였다.
  • 추론 분석을 통해 국소 이미지 스트림과 골격 스트림 모두 성능 향상에 기여했음을 확인하였으며, 전체 세 스트림 모델이 단일 또는 双스트림 변형보다 뛰어난 성능을 보였다.
  • MS-ASL 데이터셋에서 83.86%의 Top-1 정확도를 달성하여 제안된 방법의 일반화 능력이 WLASL 벤치마크를 초월함을 입증하였다.
  • 성능 향상에도 불구하고 어휘 크기가 증가함에 따라 정확도가 크게 떨어졌으며(예: WLASL2000에서 47.26%), 이는 클래스당 데이터 부족이 여전히 핵심 과제임을 시사한다.
  • 모든 WLASL 서브셋에서 일관되게 15%의 향상이 이루어진 것으로 보아, 추가 스트림이 데이터셋 규모와 복잡성 증가로 인한 성능 저하를 효과적으로 완화함을 확인하였다.
  • 결과는 유사한 운동을 하지만 다른 손 모양이나 표정을 가진 제스처를 구분하는 데 국소적 및 공간적 정보가 필수적임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.