Skip to main content
QUICK REVIEW

[논문 리뷰] CVT-SLR: Contrastive Visual-Textual Transformation for Sign Language Recognition with Variational Alignment

Jiangbin Zheng, Yile Wang|arXiv (Cornell University)|2023. 03. 10.
Hand Gesture Recognition Systems인용 수 4
한 줄 요약

이 논문은 변분 오토에인코더(VAE)를 활용해 시각적 및 텍스처적 모odal 간의 암묵적 정렬을 가능하게 하면서도 완전한 사전학습된 언어 지식을 통합하는 새로운 단일 쿠(sign language recognition, SLR) 프레임워크인 CVT-SLR를 제안한다. 대비적 다중모달 정렬 손실과 비디오-글라스 어댑터를 결합함으로써, 더 단순한 아키텍처임에도 불구하고 PHOENIX-2014 및 PHOENIX-2014T에서 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

Sign language recognition (SLR) is a weakly supervised task that annotates sign videos as textual glosses. Recent studies show that insufficient training caused by the lack of large-scale available sign datasets becomes the main bottleneck for SLR. Most SLR works thereby adopt pretrained visual modules and develop two mainstream solutions. The multi-stream architectures extend multi-cue visual features, yielding the current SOTA performances but requiring complex designs and might introduce potential noise. Alternatively, the advanced single-cue SLR frameworks using explicit cross-modal alignment between visual and textual modalities are simple and effective, potentially competitive with the multi-cue framework. In this work, we propose a novel contrastive visual-textual transformation for SLR, CVT-SLR, to fully explore the pretrained knowledge of both the visual and language modalities. Based on the single-cue cross-modal alignment framework, we propose a variational autoencoder (VAE) for pretrained contextual knowledge while introducing the complete pretrained language module. The VAE implicitly aligns visual and textual modalities while benefiting from pretrained contextual knowledge as the traditional contextual module. Meanwhile, a contrastive cross-modal alignment algorithm is designed to explicitly enhance the consistency constraints. Extensive experiments on public datasets (PHOENIX-2014 and PHOENIX-2014T) demonstrate that our proposed CVT-SLR consistently outperforms existing single-cue methods and even outperforms SOTA multi-cue methods.

연구 동기 및 목표

  • 사전학습된 시각 및 언어 모델을 최대한 활용하여 수수료가 낮은 데이터 문제를 해결하기 위해 단일 쿠 SLR에서의 데이터 부족 문제를 해결한다.
  • 기존의 단일 쿠 SLR에서 사용하는 전통적 맥락 모듈을 대체하기 위해, 암묵적 다중모달 정렬을 가능하게 하고 사전학습된 언어 지식을 완전히 유지할 수 있는 변분 오토에인코더(VAE) 기반 모듈을 도입한다.
  • 양성 및 음성 샘플 쌍을 구분하는 대비 학습 기반의 정렬 알고리즘을 통해 명시적 다중모달 일致성을 향상시킨다.
  • 사전학습된 시각 및 언어 인코더의 원래 파rameter를 업데이트하지 않으면서도 효과적인 미세조정을 가능하게 하는 비디오-글라스 어댑터를 설계한다.
  • 고도로 발전된 다중모달 정렬을 갖춘 단일 쿠 프레임워크가 복잡한 다중 쿠 SOTA 방법을 능가할 수 있음을 입증한다.

제안 방법

  • 사전학습된 언어 모델을 사용하여 가짜 번역 작업을 기반으로 VAE 기반 모듈을 단일 쿠 SLR의 표준 맥락 모듈로 대체한다.
  • VAE의 오토에인코딩 구조를 활용해 입력 모달을 재구성함으로써 시각적 및 텍스트적 특징 간의 암묵적 정렬을 이끌어내어 모달 간의 일관성을 강제한다.
  • 양성 시각-텍스트 특징 쌍 간의 유사도를 최대화하고 음성 쌍 간의 유사도를 최소화하는 대비적 다중모달 정렬 손실을 도입한다.
  • 사전학습된 시각 및 언어 인코더의 기존 파rameter를 업데이트하지 않으면서도 효과적인 미세조정을 가능하게 하는 비디오-글라스 어댑터를 설계한다.
  • 시퀀스 생성을 위한 CTC 손실과 다중모달 일관성에 대한 대비 정렬 손실을 동시에 최적화한다.
  • GradCAM을 적용하여 정렬 지도를 시각화하고 수작업으로 손과 얼굴 영역에 대한 주의 집중을 분석함으로써, 수중어의 언어학 원칙과의 정렬을 검증한다.

실험 결과

연구 질문

  • RQ1VAE 기반 모듈이 단일 쿠 SLR에서 표준 맥락 모듈을 효과적으로 대체하면서도 암묵적 다중모달 정렬을 가능하게 할 수 있는가?
  • RQ2VAE를 통해 완전한 사전학습된 언어 모델을 통합하면 표준 맥락 모듈 대비 SLR 성능 향상에 기여하는가?
  • RQ3대비 정렬 손실이 명시적 다중모달 일관성을 향상시키고 더 높은 인식 정확도를 이끌 수 있는가?
  • RQ4암묵적 및 명시적 정렬을 갖춘 제안된 단일 쿠 프레임워크가 다중 쿠 SOTA 방법을 능가할 수 있는가?
  • RQ5사전학습된 시각 및 언어 모듈의 사용이 학습 수렴 속도와 최종 성능에 어떤 영향을 미치는가?

주요 결과

  • CVT-SLR는 PHOENIX-2014 및 PHOENIX-2014T에서 모두 새로운 최신 기술 수준 성능을 달성하여 기존의 단일 쿠 및 다중 쿠 방법들을 능가한다.
  • 제거 실험을 통해 대비 정렬 손실이 성능 향상에 뚜렷한 기여를 함을 확인하였으며, 손실 가중치가 10.0일 때 최적의 성능을 기록한다.
  • 사전학습된 시각 및 텍스트 모듈을 사용한 모델는 더 빠른 수렴 속도를 보이며 더 낮은 학습 손실을 기록하며, 이는 더 낮은 WER 점수와 상관관계가 있다.
  • 정렬 지도 분석 결과, 모델이 수중어의 핵심 영역인 손과 얼굴에 주의를 집중하고 있음을 확인하여 언어학 원칙과의 정렬을 검증한다.
  • 완전한 사전학습된 언어 지식을 갖춘 VAE 기반 모듈은 표준 RNN/LSTM 모듈 대비 성능 향상을 보이며, 사전 지식의 유용성을 입증한다.
  • 비디오-글라스 어댑터를 통해 사전학습된 시각 및 언어 인코더의 전체 능력을 유지하면서도 효과적인 미세조정을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.