Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Sign Language Translation with Monolingual Data by Sign Back-Translation

Hao Zhou, Wengang Zhou|arXiv (Cornell University)|2021. 05. 26.
Hand Gesture Recognition Systems참고 문헌 50인용 수 11
한 줄 요약

이 논문은 두 단계 과정을 통해 단일 언어 텍스트 데이터를 활용하여 수어 번역(SLT) 성능을 햖थ하는 Sign Back-Translation (SignBT) 방법을 제안한다: 먼저 텍스트에서 글로스로의 번역; 그 다음, 사전에 애너테이션된 수어 특징 세그먼트를 연결하여 글로스에서 수어 시퀀스로의 생성. 이 방법은 PHOENIX-2014T와 새로 도입된 CSL-Daily 데이터셋 모두에서 SLT 성능을 크게 향상시키며, PHOENIX-2014T에서 BLEU-4 점수 2.6점 향상, CSL-Daily 테스트 세트에서 BLEU-4 점수 21.34를 기록한다.

ABSTRACT

Despite existing pioneering works on sign language translation (SLT), there is a non-trivial obstacle, i.e., the limited quantity of parallel sign-text data. To tackle this parallel data bottleneck, we propose a sign back-translation (SignBT) approach, which incorporates massive spoken language texts into SLT training. With a text-to-gloss translation model, we first back-translate the monolingual text to its gloss sequence. Then, the paired sign sequence is generated by splicing pieces from an estimated gloss-to-sign bank at the feature level. Finally, the synthetic parallel data serves as a strong supplement for the end-to-end training of the encoder-decoder SLT framework. To promote the SLT research, we further contribute CSL-Daily, a large-scale continuous SLT dataset. It provides both spoken language translations and gloss-level annotations. The topic revolves around people's daily lives (e.g., travel, shopping, medical care), the most likely SLT application scenario. Extensive experimental results and analysis of SLT methods are reported on CSL-Daily. With the proposed sign back-translation method, we obtain a substantial improvement over previous state-of-the-art SLT methods.

연구 동기 및 목표

  • 수어 번역(SLT)에서 병렬 수어 데이터와 텍스트 데이터의 심각한 부족 문제를 해결하기 위해.
  • 대규모 단일 언어 텍스트 데이터를 활용하여 SLT 훈련을 보완할 수 있는지 탐색하기 위해.
  • 텍스트와 수어 영상 간의 모odal 갭을 메우는 현실적이고 효과적인 데이터 증강 파이프라인을 개발하기 위해.
  • 풍부한 애너테이션을 가진 연속 수어 번역을 위한 새로운 대규모 벤치마크인 CSL-Daily를 구축하기 위해.
  • 서브백트랜스레이션을 통해 생성된 합성 데이터가 SLT 모델 성능을 크게 향상시킬 수 있음을 입증하기 위해.

제안 방법

  • 두 단계 수어 백트랜스레이션 파이프라인을 설계함: 텍스트에서 글로스로의 번역, 그 다음 글로스에서 수어 시퀀스로의 생성.
  • 기존의 텍스트-글로스 쌍을 기반으로 훈련된 신경 시퀀스-투-시퀀스 모델을 사용해 텍스트에서 글로스로의 번역을 수행함.
  • 글로스에서 수어로의 변환은 글로스-투-서브 백에서 사전에 분할된 수어 특징 클립을 특징 수준에서 연결함으로써 달성됨.
  • 수어 영상에서 정확한 글로스 경계를 식별하기 위해 CTC 기반의 수어-투-글로스 정렬 네트워크를 사용해 수어 분할을 수행함.
  • 합성 데이터 쌍(단일 언어 텍스트, 합성 수어 특징 시퀀스)을 사용해 엔드 투 엔드 인코더-디코더 SLT 모델을 미세조정함.
  • 이 방법은 전체 과정을 직접 영상 생성 없이 시퀀스 연결 연산을 포함한 텍스트-투-텍스트 백트랜스레이션 문제로 간주함.

실험 결과

연구 질문

  • RQ1단일 언어 텍스트 데이터가 수어 번역 성능 향상에 효과적으로 활용될 수 있는가?
  • RQ2직접 영상 생성 없이 텍스트와 수어 영상 간의 모달 갭을 어떻게 메울 수 있는가?
  • RQ3서브백트랜스레이션을 통해 생성된 합성 데이터가 SLT 모델의 강건성과 정확도를 향상시키는가?
  • RQ4합성 데이터의 품질과 양이 SLT 모델 성능에 어떤 영향을 미치는가?
  • RQ5CSL-Daily처럼 대규모이자 다양한 데이터를 포함하고 잘 애너테이션된 SLT 벤치마크는 더 효과적이고 표준화된 SLT 방법 평가를 지원할 수 있는가?

주요 결과

  • 제안된 SignBT 방법은 PHOENIX-2014T 데이터셋에서 베이스라인 대비 BLEU-4 점수 2.6점 향상 달성.
  • CSL-Daily 벤치마크에서 테스트 세트에서 BLEU-4 점수 21.34를 기록하여 베이스라인을 크게 앞서며 성능 향상을 보임.
  • 합성 데이터의 양이 증가할수록 성능이 점진적으로 향상되어 이 방법의 확장성 입증.
  • 더 높은 품질의 합성 데이터—더 정확한 텍스트-글로스 모델을 사용해 생성된 데이터—는 더 나은 SLT 모델 성능을 이끌어내며, 이는 데이터 품질에 민감한 방법임을 확인함.
  • 빈 입력 상황에서도 모델이 약간의 성능 향상을 보이며, 합성 데이터가 단순한 언어 모델링을 넘어서 의미 있는 기여를 함을 시사함.
  • 이 방법은 다양한 어휘 크기에서 효과적이며, 텍스트와 수어 양쪽 모두 어휘가 더 큰 CSL-Daily에서 더 큰 성능 향상을 보이며, 고복잡도 환경에서의 데이터 증강 효과가 더 뚜렷함을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.