[논문 리뷰] Clean Text and Full-Body Transformer: Microsoft's Submission to the WMT22 Shared Task on Sign Language Translation
이 논문은 스위스 독일어 수어에서 말하는 언어로의 번역을 위한 WMT22 공동 과제에 마이크로소프트가 제출한 결과를 제시한다. 사전에 훈련된 I3D 모델에서 유도한 전신 영상 특징과 정제된 텍스트 처리 파이프라인을 활용하여, 스위스 독일어 수어 번역 테스트 세트에서 최고의 BLEU 점수(0.6)와 1위 인간 평가 결과를 달성하였다. 또한 입술 읽기 특징과 어휘 데이터셋을 통합함으로써 개발 세트에서 BLEU 점수를 1.08로 향상시켜, 저자원 수어 번역에서 다중모달 입력과 데이터 정제의 효과를 입증하였다.
This paper describes Microsoft's submission to the first shared task on sign language translation at WMT 2022, a public competition tackling sign language to spoken language translation for Swiss German sign language. The task is very challenging due to data scarcity and an unprecedented vocabulary size of more than 20k words on the target side. Moreover, the data is taken from real broadcast news, includes native signing and covers scenarios of long videos. Motivated by recent advances in action recognition, we incorporate full body information by extracting features from a pre-trained I3D model and applying a standard transformer network. The accuracy of the system is further improved by applying careful data cleaning on the target text. We obtain BLEU scores of 0.6 and 0.78 on the test and dev set respectively, which is the best score among the participants of the shared task. Also in the human evaluation the submission reaches the first place. The BLEU score is further improved to 1.08 on the dev set by applying features extracted from a lip reading model.
연구 동기 및 목표
- 높은 어휘 다양성을 지닌 실생활 저자원 환경에서 수어에서 말하는 언어로의 번역 과제를 해결하기 위해.
- 사전에 훈련된 I3D 모델을 활용해 전신 영상 표현을 통한 수어 운동을 인코딩하여 번역 성능을 향상시키기 위해.
- 체계적인 텍스트 정제와 어휘 데이터셋 통합을 통해 모델의 일반화 능력과 정확도를 향상시키기 위해.
- 특히 전신 및 입술 읽기 특징을 포함한 다중모달 입력이 수어 번역 품질에 미치는 영향을 평가하기 위해.
제안 방법
- 사전에 훈련된 I3D 모델을 사용해 영상 프레임에서 전신 수어 운동을 인코딩하는 영상 임베딩을 추출하였다.
- 표준 Transformer 디코더 아키텍처를 적용하여 I3D 임베딩 시퀀스에서 말하는 언어 번역을 생성하였다.
- 어휘 크기와 고립어를 줄이기 위해 광범위한 텍스트 전처리를 수행하여 모델의 일반화 능력과 훈련 효율성을 향상시켰다.
- 입술 영역에서의 보조적 시각적 특징을 추출하기 위해 사전에 훈련된 AV-HuBERT 입술 읽기 모델을 통합하여 희귀어 및 기능어의 인식을 향상시켰다.
- 전신 및 입술 읽기 특징을 통합한 공동 입력 표현을 구성하여 시퀀스 모델링 및 번역 정확도를 향상시켰다.
- 공개된 수어 어휘집(SignSuisse)을 통합하여 기존 기반 모델이 잘 예측하지 못했던 고빈도 기능어의 표현을 강화하였다.
실험 결과
연구 질문
- RQ1사전에 훈련된 I3D 모델에서 유도한 전신 영상 특징이 저자원 환경에서 수어 번역 성능을 크게 향상시킬 수 있는가?
- RQ2텍스트 정제가 수어 번역 시스템에서 어휘 크기를 얼마나 줄이고 BLEU 점수를 향상시키는가?
- RQ3AV-HuBERT에서 유도한 입술 읽기 특징이 수어 번역에서 희귀어나 기능어의 인식에 얼마나 효과적인가?
- RQ4어휘 데이터셋 통합이 기존 엔드 투 엔드 모델이 자주 놓치는 고빈도·저의미 모호성 수어를 예측하는 데 모델 능력을 향상시키는가?
- RQ5WMT22 공동 과제의 성능 지표가 PHOENIX-2014T와 같은 기존 벤치마크와 비교해 어떻게 다를지, 이는 과제 난이도에 대해 어떤 시사점을 갖는가?
주요 결과
- 공식 WMT2022 테스트 세트에서 BLEU 점수 0.6을 기록하여 참가자 7명 중 최고 성능을 달성하였다.
- 인간 평가에서 1위를 기록하여 생성된 번역의 자연스러움과 유창성에서 뛰어난 성능을 입증하였다.
- AV-HuBERT에서 유도한 입술 읽기 특징을 추가함으로써 개발 세트에서 BLEU 점수를 I3D 모델 전용일 때의 0.78에서 1.08로 향상시켰다.
- 어휘 데이터셋 통합으로 성능이 추가로 향상되었으며, 특히 이전에 잘 예측되지 않았던 기능어 'auf wiedersehen' 등의 예측 능력이 향상되었다.
- WMT 데이터로 훈련된 모델는 PHOENIX-2014T 기준 최고 성능 모델보다 유의미하게 열등한 성능을 보였으며, 이는 WMT22 과제가 데이터 품질과 도메인 제약으로 인해 상당히 더 어려운 과제임을 시사한다.
- PHOENIX-2014T 데이터에 문장 끝 마침표가 존재함에 따라 BLEU 점수에 1%의 상대적 향상이 있었으며, 이는 BLEU 점수가 문장 부호 및 형식에 민감함을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.