Skip to main content
QUICK REVIEW

[논문 리뷰] End-to-end Speech Translation via Cross-modal Progressive Training

Rong Ye, Mingxuan Wang|arXiv (Cornell University)|2021. 04. 21.
Natural Language Processing Techniques참고 문헌 36인용 수 8
한 줄 요약

이 논문은 공유된 Transformer 아키텍처를 사용하여 음성-텍스트 번역(ST), 음성 인식(ASR), 기계 번역(MT)을 동시에 학습하는 XSTNet을 제안한다. 자기지도 학습 기반 Wav2vec2.0 표현, 병렬 텍스트 데이터를 활용한 다중 작업 학습, 점진적 학습 전략을 통해 XSTNet은 MuST-C에서 평균 BLEU 점수 28.8을 달성하여 이전 방법보다 3.2 BLEU 포인트 높은 최신 기술 수준(SOTA) 성능을 보였다.

ABSTRACT

End-to-end speech translation models have become a new trend in research due to their potential of reducing error propagation. However, these models still suffer from the challenge of data scarcity. How to effectively use unlabeled or other parallel corpora from machine translation is promising but still an open problem. In this paper, we propose Cross Speech-Text Network (XSTNet), an end-to-end model for speech-to-text translation. XSTNet takes both speech and text as input and outputs both transcription and translation text. The model benefits from its three key design aspects: a self-supervised pre-trained sub-network as the audio encoder, a multi-task training objective to exploit additional parallel bilingual text, and a progressive training procedure. We evaluate the performance of XSTNet and baselines on the MuST-C En-X and LibriSpeech En-Fr datasets. In particular, XSTNet achieves state-of-the-art results on all language directions with an average BLEU of 28.8, outperforming the previous best method by 3.2 BLEU. Code, models, cases, and more detailed analysis are available at https://github.com/ReneeYe/XSTNet.

연구 동기 및 목표

  • 비정렬된 데이터와 병렬 텍스트 데이터를 활용하여 종단 간 음성 번역에서의 데이터 부족 문제를 해결하기 위해.
  • ST, ASR, MT 작업을 동시에 학습시켜 모델 일반화 능력을 향상시키고 오류 전파를 줄이기 위해.
  • 점진적으로 사전 훈련 및 다중 작업 미세조정을 활용하는 효과적인 훈련 전략을 설계하기 위해.
  • 자기지도 음성 표현과 외부 MT 데이터가 저자원 ST 환경에서 효과적인지 입증하기 위해.

제안 방법

  • XSTNet은 음성 인코더로 자기지도 학습 기반 Wav2vec2.0 하위 네트워크를 사용하여 맥락 기반 음성 표현을 생성한다.
  • 모델은 ST, ASR, MT 작업 간에 단일 Transformer 인코더와 디코더를 공유하여 다중 작업 학습을 가능하게 한다.
  • 외부 MT 병렬 데이터(예: WMT, OpenSubtitles)를 활용해 모델을 사전 훈련하고 일반화 능력을 향상시킨다.
  • 점진적 다중 작업 훈련 절차를 적용하여, 외부 MT 데이터에서의 사전 훈련을 거친 후 ST, ASR, MT 지도 데이터를 동시에 활용한 공동 미세조정을 수행한다.
  • 모델은 음성 또는 텍스트 입력을 수락하며, 동시에 번역과 음성 전사 결과를 출력하여 모든 작업의 공동 최적화를 가능하게 한다.
  • Wav2vec2.0 이후에 두 개의 1차원 합성곱 층을 추가하여 시퀀스 길이를 줄이고 음성 및 텍스트 시퀀스 차원을 일치시킨다.
Figure 1: The model structure of XSTNet. It accepts either audio or text input. For the audio input, we deploy wav2vec2.0 followed by two convolution layers to get the audio embedding. The Transformer encoder and decoder are shared for both modalities.
Figure 1: The model structure of XSTNet. It accepts either audio or text input. For the audio input, we deploy wav2vec2.0 followed by two convolution layers to get the audio embedding. The Transformer encoder and decoder are shared for both modalities.

실험 결과

연구 질문

  • RQ1ST, ASR, MT 작업을 동시에 학습시키는 다중 작업 학습이 저자원 음성 번역 환경에서 성능 향상에 기여하는가?
  • RQ2Wav2vec2.0를 활용한 자기지도 사전 훈련이 종단 간 ST에서 데이터 요구량을 줄이는 데 얼마나 효과적인가?
  • RQ3외부 MT 데이터를 활용한 점진적 훈련이 ST 모델의 수렴성과 일반화 능력 향상에 기여하는가?
  • RQ4대규모 외부 MT 데이터를 통합할 경우 ST 성능 향상에 어느 정도 기여하는가?

주요 결과

  • XSTNet은 MuST-C 데이터셋에서 이전 최고 성능 방법보다 3.2 BLEU 포인트 높은 새로운 최신 기술 수준 평균 BLEU 점수 28.8을 달성했다.
  • 외부 WMT 데이터에서의 사전 훈련으로 1.2 BLEU 향상이 이루어져 대규모 MT 사전 훈련의 효과성을 입증했다.
  • 이전 단계의 데이터를 유지하면서 미세조정을 수행하는 점진적 훈련 전략이 더 높은 성능을 보여, 단계별 훈련의 유용성을 확인했다.
  • ST, ASR, MT를 동시에 학습시키는 다중 작업 미세조정이 ST 전용 미세조정보다 더 우수한 성능을 보여, 모델의 강건성 향상을 확인했다.
  • 외부 MT 데이터 크기를 증가시킬 경우(예: WMT에서 OpenSubtitles로 전환), MuST-C En-De에서 ST BLEU 점수가 27.1에서 27.8로 상승하여 데이터 크기의 영향을 입증했다.
  • 특히 저자원 환경에서 ST 데이터로만 훈련된 모델에 비해 XSTNet은 더 빠르게 수렴하고 더 우수한 일반화 능력을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.