Skip to main content
QUICK REVIEW

[논문 리뷰] A Simple Multi-Modality Transfer Learning Baseline for Sign Language Translation

Yutong Chen, Fangyun Wei|arXiv (Cornell University)|2022. 03. 08.
Hand Gesture Recognition Systems인용 수 14
한 줄 요약

이 논문은 일반 도메인 데이터에서 시각 및 언어 네트워크를 점진적으로 사전 훈련한 후 신호 언어 데이터셋에서 미세 조정하는 간단하면서도 효과적인 다중 모odal 전이 학습 베이스라인을 제안한다. 이 방법은 신호 → 글로스 및 글로스 → 텍스트 구성 요소를 연결하는 시각-언어 매핑 기반의 아키텍처를 사용하여, 제한된 병렬 데이터에도 불구하고 PHOENIX-2014T와 CSL-Daily에서 각각 BLEU-4 점수 26.75와 45.62로 최신 기준 성능을 달성한다.

ABSTRACT

This paper proposes a simple transfer learning baseline for sign language translation. Existing sign language datasets (e.g. PHOENIX-2014T, CSL-Daily) contain only about 10K-20K pairs of sign videos, gloss annotations and texts, which are an order of magnitude smaller than typical parallel data for training spoken language translation models. Data is thus a bottleneck for training effective sign language translation models. To mitigate this problem, we propose to progressively pretrain the model from general-domain datasets that include a large amount of external supervision to within-domain datasets. Concretely, we pretrain the sign-to-gloss visual network on the general domain of human actions and the within-domain of a sign-to-gloss dataset, and pretrain the gloss-to-text translation network on the general domain of a multilingual corpus and the within-domain of a gloss-to-text corpus. The joint model is fine-tuned with an additional module named the visual-language mapper that connects the two networks. This simple baseline surpasses the previous state-of-the-art results on two sign language translation benchmarks, demonstrating the effectiveness of transfer learning. With its simplicity and strong performance, this approach can serve as a solid baseline for future research. Code and models are available at: https://github.com/FangyunWei/SLRT.

연구 동기 및 목표

  • 기존 데이터셋이 일반적으로 신경 기반 기계 번역 모델에 비해 훨씬 적은 병렬 예제(약 10K~20K개)를 제공하는 신호 언어 번역의 데이터 부족 문제를 해결하기 위해.
  • 시각 및 다국어 NLP 분야의 대규모 일반 도메인 데이터셋에서의 전이 학습을 활용하여 신호 언어 번역 성능을 향상시키기 위해.
  • 신호 → 글로스 및 글로스 → 텍스트 작업을 분리하여 독립적으로 사전 훈련한 후, 시각-언어 매핑을 통해 공동으로 미세 조정하여 다중 모odal 간의 정렬을 향상시키기 위해.
  • 기존 최신 기준 방법들을 능가하는 강력하고 단순한 베이스라인을 설정하여 표준 벤치마크에서 성능을 확보하기 위해.

제안 방법

  • 신호 언어 데이터셋 내에서의 사전 훈련을 위해, 일반 도메인 인간 동작 데이터셋(예: Kinetics)에서 신호 → 글로스 네트워크를 사전 훈련한 후, 도메인 내 신호 언어 데이터셋에서 미세 조정한다.
  • 대규모 다국어 코퍼스에서 사전 훈련된 denoising autoencoder인 mBART를 사용하여 글로스 → 텍스트 네트워크를 사전 훈련한 후, 글로스 → 텍스트 병렬 데이터에서 미세 조정한다.
  • 신호 → 글로스 및 글로스 → 텍스트 네트워크를 연결하는 시각-언어 매핑(Visual-Language Mapper, V-L Mapper)을 도입하여 공동 최적화 및 다중 모달 특징 정렬을 가능하게 한다.
  • 이중 단계 파이프라인을 사용한다: 먼저 신호 영상에서 글로스 시퀀스를 예측하고, 그 다음 이를 목표 언어 텍스트로 번역한다.
  • 점진적 미세 조정을 적용한다: 먼저 각 모odal을 별도로 사전 훈련한 후, V-L Mapper를 포함하여 전체 모델을 공동으로 미세 조정한다.
  • 대규모 병렬 신호 언어 데이터에 대한 의존도를 줄이기 위해 일반 도메인 데이터에서의 외부 감독을 활용한다.

실험 결과

연구 질문

  • RQ1제한된 병렬 데이터에도 불구하고 일반 도메인 시각 및 다국어 데이터에서의 점진적 사전 훈련이 신호 언어 번역 성능 향상에 기여하는가?
  • RQ2전체 모델을 동시에 훈련하는 것에 비해, 신호 → 글로스 및 글로스 → 텍스트 구성 요소에 대해 분리된 사전 훈련-미세 조정 전략은 얼마나 효과적인가?
  • RQ3시각-언어 매핑이 다중 모달 정렬 및 신호 언어 번역 품질 향상에 얼마나 기여하는가?
  • RQ4단순한 전이 학습 베이스라인은 더 복잡한 아키텍처에 비해 표준 신호 언어 번역 벤치마크에서 더 뛰어난 성능을 낼 수 있는가?
  • RQ5모델의 실패 유형은 무엇이며, 특히 수치나 위치 명사와 같은 희귀 엔티티에 대해 어떻게 나타나는가?

주요 결과

  • 제안된 방법은 PHOENIX-2014T 테스트 세트에서 BLEU-4 점수 26.75를 기록하여 이전 SOTA(24.32)를 초월한다.
  • CSL-Daily 벤치마크에서는 BLEU-4 점수 45.62를 기록하여 새로운 최신 기준 성능을 수립한다.
  • V-L Mapper를 통한 시각적 및 언어적 신호 통합 덕분에 얼굴 표정 및 비수기적 특징을 더 잘 처리하는 데에 강건성이 향상된다.
  • 정성적 분석 결과, '매우'와 같은 부사적 강도 표현(예: 'extremely')과 같은 의미적 뉘앙스를 글로스 전용 파이프라인에서 손실하는 것과 달리, 모델이 올바르게 포착하는 것으로 나타났다.
  • 실패 케이스 분석 결과, 훈련 데이터에서 희귀 엔티티(예: 수치, 위치 명사)의 부족으로 인해 인식에 어려움을 겪는 것으로 확인되었다.
  • 제거 실험 결과, 일반 도메인 데이터에서의 점진적 사전 훈련이 성능 향상에 상당히 기여함을 확인하여 전이 학습 전략의 타당성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.