Skip to main content
QUICK REVIEW

[논문 리뷰] Natural Language-Assisted Sign Language Recognition

Ronglai Zuo, Fangyun Wei|arXiv (Cornell University)|2023. 03. 21.
Hand Gesture Recognition Systems인용 수 5
한 줄 요약

이 논문은 어휘의 의미 정보를 활용하여 수어 인식 성능을 햖थन하는 자연어 보조 수어 인식(NLA-SLR) 프레임워크를 제안한다. 어휘 간 의미 유사도를 활용한 언어 인지 레이블 스무딩과 이중 모odal 믹스업을 도입하여 특징의 분리도를 향상시키며, MSASL, WLASL, NMFs-CSL 벤치마크에서 최신 기술 수준(SOTA) 성능을 달성하여 WLASL2000에서 61.05%의 top-1 정확도를 기록했다.

ABSTRACT

Sign languages are visual languages which convey information by signers' handshape, facial expression, body movement, and so forth. Due to the inherent restriction of combinations of these visual ingredients, there exist a significant number of visually indistinguishable signs (VISigns) in sign languages, which limits the recognition capacity of vision neural networks. To mitigate the problem, we propose the Natural Language-Assisted Sign Language Recognition (NLA-SLR) framework, which exploits semantic information contained in glosses (sign labels). First, for VISigns with similar semantic meanings, we propose language-aware label smoothing by generating soft labels for each training sign whose smoothing weights are computed from the normalized semantic similarities among the glosses to ease training. Second, for VISigns with distinct semantic meanings, we present an inter-modality mixup technique which blends vision and gloss features to further maximize the separability of different signs under the supervision of blended labels. Besides, we also introduce a novel backbone, video-keypoint network, which not only models both RGB videos and human body keypoints but also derives knowledge from sign videos of different temporal receptive fields. Empirically, our method achieves state-of-the-art performance on three widely-adopted benchmarks: MSASL, WLASL, and NMFs-CSL. Codes are available at https://github.com/FangyunWei/SLRT.

연구 동기 및 목표

  • 시각적으로 구별하기 어려운 수어(signs, VISigns)로 인해 시각 기반 모델의 성능이 제한되는 문제를 해결한다.
  • 언어적 의미를 지닌 어휘(glosses)의 의미 정보를 활용하여 시각적 특징 외의 정보로도 인식 성능을 향상시킨다.
  • 유사한 외관을 지닌 VISigns이지만 의미가 다를 경우의 학습 곤란 문제를 해결하기 위해 레이블 스무딩에 의미 유사도를 통합한다.
  • 의미가 다를 수 있는 VISigns의 특징을 잠재 공간에서 최대한 분리되도록 하기 위해 다중 모달 특징 융합을 통한 특징 분리도를 극대화한다.
  • 다양한 시간적 수용장치를 갖춘 RGB 영상과 인간 체형 관절 표현을 융합하는 새로운 비디오-키포인트 네트워크 백본을 개발한다.

제안 방법

  • 언어 인지 레이블 스무딩 도입: fastText 임베딩를 활용해 참조 어휘와 어휘 어휘집 내 모든 어휘 간의 정규화된 의미 유사도를 계산하여 소프트 레이블을 생성한다.
  • 이중 모달 믹스업 적용: 수어 영상의 시각적 특징과 fastText에서 생성된 어휘 특징을 혼합하여 새로운 표현과 레이블을 생성함으로써 분류 능력을 향상시킨다.
  • RGB 영상 프레임과 인간 신체 관절 시퀀스를 동시에 모델링하는 비디오-키포인트 네트워크 백본 설계 및 다중 수용장치 지식 전이 기반 학습 적용.
  • 보조 분류기(FC2)를 주 분류기(FC1)와 통합하여 언어 정보를 전파하고 일반화 능력을 향상시키며, 후반 학습 단계에서 분류 손실을 우선시하기 위해 적응형 손실 가중치를 적용한다.
  • 이중 단계 학습 전략 적용: 먼저 표준 교차 엔트로피 손실을 사용해 백본과 분류기를 학습한 후, 이후에 믹스업과 레이블 스무딩 구성요소를 통한 미세조정을 수행한다.
  • fastText를 사용해 어휘 간 의미 유사도를 계산하며, 이는 레이블 스무딩의 스무딩 가중치 및 이중 모달 믹스업의 기초로 활용된다.

실험 결과

연구 질문

  • RQ1어휘 간 의미 유사도가 외관은 유사하지만 의미가 다른 수어(signs)의 학습 안정성과 성능 향상에 기여하는가?
  • RQ2이중 모달 믹스업을 통해 시각적 특징과 어휘 특징을 융합하면 잠재 공간 내 수어 표현의 분리도가 향상되는가?
  • RQ3표준 레이블 스무딩에 비해 언어 인지 레이블 스무딩이 유사한 외관을 지닌 VISigns를 다룰 때 더 우수한 성능을 내는가?
  • RQ4제안된 비디오-키포인트 네트워크 백본은 수어 영상의 시공간 동적 특징을 모델링하는 데 기존 표준 모델에 비해 어떻게 비교되는가?
  • RQ5언어 인지 레이블 스무딩과 이중 모달 믹스업의 조합이 의미가 유사하거나 다를 경우에 관계없이 일관된 성능 향상을 이끌 수 있는가?

주요 결과

  • 언어 인지 레이블 스무딩은 테스트된 모든 스무딩 파라미터(ε = 0.1, 0.2, 0.3)에서 기존 레이블 스무딩을 일관되게 능가하며, WLASL2000에서 0.92%에서 1.24%까지 top-1 정확도 향상을 기록했다.
  • 이중 모달 믹스업은 모든 벤치마크에서 1% 이상의 top-1 정확도 향상을 이끌었으며, 특히 시각적으로 유사하고 의미적으로도 유사한 수어(VS-S)에서 가장 높은 성과를 보였고, 정확도는 50.50%에서 65.35%로 상승했다.
  • 언어 인지 레이블 스무딩과 이중 모달 믹스업의 조합은 WLASL2000에서 61.05%의 최고 top-1 정확도를 기록하며 이전 최신 기술 수준(SOTA) 방법을 초월했다.
  • 절단 실험 결과, 보조 분류기와 손실 가중 전략이 성능 향상에 크게 기여하며, 주된 성과는 두 분류기의 통합에서 비롯된 것으로 확인되었다.
  • 의미가 다를 수 있지만 외관은 유사한 VISigns(VS-D)에 대해서도 상당한 성능 향상을 기록하여, 정확도를 50.93%에서 56.07%로 상승시켰으며, 의미가 다를 수 있지만 외관이 유사한 수어를 다루는 데 효과적임을 입증했다.
  • 비디오-키포인트 네트워크 백본은 다양한 시간적 수용장치에서 RGB와 키포인트 모odal을 효과적으로 모델링함으로써 성능 향상에 기여하였으며, 절단 실험을 통해 이는 검증되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.