Skip to main content
QUICK REVIEW

[논문 리뷰] SignVTCL: Multi-Modal Continuous Sign Language Recognition Enhanced by Visual-Textual Contrastive Learning

Hao Chen, Jiaze Wang|arXiv (Cornell University)|2024. 01. 22.
Hand Gesture Recognition Systems인용 수 4
한 줄 요약

SignVTCL는 비디오, 관절점, 광학 흐름 데이터를 활용하여 시각적 표현을 향상시키고, 글자 수준 및 문장 수준에서 시각-언어 대비 학습을 통합한 다중 모odal 연속된 수어 인식 프레임워크를 제안한다. 이는 Phoenix-2014, Phoenix-2014T, CSL-Daily에서 최신 기술 수준 성능을 달성하여 개발 세트의 단어 오류율을 17.3%로, 테스트 세트를 17.6%로 감소시킨다.

ABSTRACT

Sign language recognition (SLR) plays a vital role in facilitating communication for the hearing-impaired community. SLR is a weakly supervised task where entire videos are annotated with glosses, making it challenging to identify the corresponding gloss within a video segment. Recent studies indicate that the main bottleneck in SLR is the insufficient training caused by the limited availability of large-scale datasets. To address this challenge, we present SignVTCL, a multi-modal continuous sign language recognition framework enhanced by visual-textual contrastive learning, which leverages the full potential of multi-modal data and the generalization ability of language model. SignVTCL integrates multi-modal data (video, keypoints, and optical flow) simultaneously to train a unified visual backbone, thereby yielding more robust visual representations. Furthermore, SignVTCL contains a visual-textual alignment approach incorporating gloss-level and sentence-level alignment to ensure precise correspondence between visual features and glosses at the level of individual glosses and sentence. Experimental results conducted on three datasets, Phoenix-2014, Phoenix-2014T, and CSL-Daily, demonstrate that SignVTCL achieves state-of-the-art results compared with previous methods.

연구 동기 및 목표

  • 연속된 수어 인식(CSLR)에서 대규모 애너테이션된 수어 데이터셋의 부족 문제를 해결한다.
  • 통합된 기반 모델에서 비디오, 관절점, 광학 흐름 모달을 융합하여 시각적 표현 학습을 향상시킨다.
  • 글자 수준 및 문장 수준에서 시각-언어 정렬을 통한 자연어 감독을 활용하여 모델의 일반화 능력을 향상시킨다.
  • 전체 비디오의 글자만 애너테이션된 약한 감독 환경에서, 시각적 세그먼트와 텍스트적 글자 간의 세밀한 정렬을 가능하게 하여 SLR의 약한 감독 성격을 극복한다.
  • 다중 모달 및 대비 학습 통합을 통해 여러 벤치마크에서 최신 기술 수준의 성능을 달성한다.

제안 방법

  • 비디오, 2D 자세 관절점, 광학 흐름을 통합하여 동적 운동 이해를 향상시키기 위한 공통 시각 기반 모델에 통합한다.
  • 중간 계층에서 보조 CTC 손실을 생성하기 위해 사인 피라미드 네트워크(SP)를 사용하여 시간적 스케일 전반의 특징 학습을 향상시킨다.
  • 동적 시간 왜곡(DTW)을 사용한 글자 수준 정렬 손실을 도입하여 시각적 특징과 개별 글자 간의 매칭을 수행한다.
  • 전체 문장 임베딩과 시각적 시퀀스 간의 통합적 의미 일致성을 강제하기 위해 문장 수준 정렬 손실을 구현한다.
  • 글자 수준 및 문장 수준에서 시각적 및 텍스트적 임베딩 간의 교차 모odal 유사도를 최적화하여 시각-언어 대비 학습을 적용한다.
  • 약한 애너테이션된 수어 비디오 데이터에서 종단 간(end-to-end)으로 모델을 훈련하기 위해 CTC 손실과 보조 SPN 감독을 통합한 다중 헤드 디코더를 사용한다.

실험 결과

연구 질문

  • RQ1비디오, 관절점, 광학 흐름 모달의 공동 학습이 수어 인식에서 시각적 표현 품질을 크게 향상시키는가?
  • RQ2글자 수준에서의 시각-언어 대비 학습은 개별 수어 제스처와 해당 텍스트적 글자 간의 정렬에 얼마나 효과적인가?
  • RQ3문장 수준의 시각-언어 정렬은 연속된 수어 인식에서 맥락 이해 및 정확도 향상에 어느 정도 기여하는가?
  • RQ4다중 모달 데이터와 대비 학습의 통합이 SLR에서 대규모 애너테이션된 데이터셋이 부족할 경우 발생하는 성능 저하를 완화하는 데 효과적인가?
  • RQ5각 모달(비디오, 관절점, 광학 흐름)과 훈련 손실 구성 요소가 최종 정확도에 기여하는 상대적 기여도는 어느 정도인가?

주요 결과

  • SignVTCL는 Phoenix-2014 데이터셋의 개발 세트에서 17.3%의 단어 오류율(WER)을 기록하고, 테스트 세트에서는 17.6%를 기록하여 이전 방법들을 초월한다.
  • 비디오, 관절점, 광학 흐름 인코더의 융합은 개별 모달을 사용한 경우 대비 개발 세트에서 WER을 1.1% 감소시키고, 테스트 세트에서는 1.0% 감소시킨다.
  • 글자 수준 정렬 손실의 포함으로 개발 세트의 WER는 18.3%에서 17.5%로 감소하여 세밀한 정렬의 효과를 입증한다.
  • 문장 수준 정렬은 개발 세트에서 WER를 17.7%로 낮추며 맥락 모델링 향상의 기여를 보여준다.
  • SPN 보조 손실과 모든 정렬 손실의 조합은 개발 세트에서 WER를 17.3%, 테스트 세트에서는 17.6%로 낮춰 모든 구성 요소 간의 상호보완적 작용을 확인한다.
  • 글자 수준 유사도 행렬의 시각화 결과에서 대각선 방향으로 높은 집중도가 관찰되어 시각적 및 텍스트적 표현 간 효과적인 정렬이 이루어졌음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.