[논문 리뷰] Leveraging Weakly Supervised Data to Improve End-to-End Speech-to-Text Translation
이 논문은 사전 훈련된 ASR, MT, TTS 모델에서 생성된 합성 데이터를 활용하여 엔드 투 엔드 음성-텍스트 번역 성능을 향상시키는 약한 감독 학습 방법을 제안한다. 특히 다중 화자 TTS를 통해 생성된 고품질의 합성 음성-번역 쌍으로 사전 훈련된 순서-순서 ST 모델을 미세 조정함으로써, 다중 작업 학습을 뛰어넘는 성능을 달성하며, 약한 감독 소스에서 유래한 합성 데이터만을 사용하여도 강력한 성능을 내는 데 성공한다.
End-to-end Speech Translation (ST) models have many potential advantages when compared to the cascade of Automatic Speech Recognition (ASR) and text Machine Translation (MT) models, including lowered inference latency and the avoidance of error compounding. However, the quality of end-to-end ST is often limited by a paucity of training data, since it is difficult to collect large parallel corpora of speech and translated transcript pairs. Previous studies have proposed the use of pre-trained components and multi-task learning in order to benefit from weakly supervised training data, such as speech-to-transcript or text-to-foreign-text pairs. In this paper, we demonstrate that using pre-trained MT or text-to-speech (TTS) synthesis models to convert weakly supervised data into speech-to-translation pairs for ST training can be more effective than multi-task learning. Furthermore, we demonstrate that a high quality end-to-end ST model can be trained using only weakly supervised datasets, and that synthetic data sourced from unlabeled monolingual text or speech can be used to improve performance. Finally, we discuss methods for avoiding overfitting to synthetic speech with a quantitative ablation study.
연구 동기 및 목표
- 엔드 투 엔드 음성 번역에서 대규모 병렬 음성-번역 데이터셋의 부족 문제를 해결하기 위해.
- 음성-번역 또는 텍스트-번역 쌍과 같은 약한 감독 데이터를 활용하여 모델 성능을 향상시키기 위해.
- 사전 훈련된 구성 요소에서 유래한 합성 데이터가 엔드 투 엔드 ST에서 다중 작업 학습을 능가할 수 있는지 탐색하기 위해.
- 비병렬 단일 언어 텍스트나 음성에서 유래한 합성 데이터만을 사용하여 고품질 ST 모델을 훈련시킬 수 있는지 가능성 탐색하기 위해.
- 합성 음성에 대한 과적합을 방지하기 위해, 사전 훈련된 인코더를 동결하는 등의 철저한 훈련 전략을 적용하기 위해.
제안 방법
- 대규모 약한 감독 데이터를 사용하여 ST 모델의 인코더를 ASR, 디코더를 MT 작업에 대해 사전 훈련한다.
- 고품질의 다중 화자 TTS 모델을 사용하여 MT 데이터셋의 텍스트를 음성으로 변환함으로써 합성 음성-번역 쌍을 생성한다.
- 실제 병렬 데이터와 합성 음성-번역 쌍의 조합을 사용하여 엔드 투 엔드 ST 모델을 미세 조정한다.
- 합성 오디오에 대한 과적합을 방지하기 위해, 특히 단일 화자 TTS를 사용할 경우 사전 훈련된 인코더를 동결한다.
- 비병렬 단일 언어 텍스트나 음성을 활용하여, 연결된 ASR 및 MT 시스템 또는 TTS를 통해 병렬 데이터를 합성하고, 이를 추가 사전 훈련 또는 미세 조정에 사용한다.
- 데이터 증강을 적용하고 Griffin-Lim 보코더를 사용하여 실재 및 합성 데이터 간 일관된 음성 품질을 확보한다.
실험 결과
연구 질문
- RQ1사전 훈련된 MT 및 TTS 모델에서 유래한 합성 데이터가 다중 작업 학습 대비 엔드 투 엔드 음성 번역 성능을 크게 향상시킬 수 있는가?
- RQ2고품질의 다중 화자 TTS를 사용한 데이터 합성은 단일 화자 TTS보다 더 우수한 일반화 성능을 제공하는가?
- RQ3완전히 감독된 병렬 데이터 없이도, 약한 감독 소스에서 유래한 합성 데이터만을 사용하여 고품질의 엔드 투 엔드 ST 모델을 훈련시킬 수 있는가?
- RQ4비병렬 단일 언어 텍스트나 음성에서 유래한 합성 데이터가 소량의 실재 병렬 데이터와 함께 사용될 경우, ST 성능 향상에 얼마나 효과적인가?
- RQ5예를 들어 사전 훈련된 구성 요소를 동결하는 것과 같은 훈련 전략은 합성 음성 입력에 대한 과적합을 방지하는 데 얼마나 효과적인가?
주요 결과
- 다중 화자 TTS에서 유래한 합성 데이터로 미세 조정한 결과, 다중 작업 학습을 뛰어넘어 도메인 내 테스트 세트에서 BLEU 점수 55.9, 도메인 외 테스트 세트에서 19.4를 기록했다.
- 비병렬 단일 언어 텍스트에서 유래한 합성 데이터를 사용하여 바닐라 모델의 BLEU 점수를 도메인 내 세트에서 49.1에서 55.9로, 도메인 외 세트에서 12.1에서 19.4로 향상시켰다.
- 비병렬 단일 언어 음성에서 유래한 합성 데이터를 사용하여 바닐라 모델의 BLEU 점수를 도메인 내 세트에서 52.4로, 도메인 외 세트에서 15.3으로 향상시켰지만, 텍스트 기반 합성보다는 덜 효과적이었다.
- 텍스트와 음성 양쪽에서 유래한 합성 데이터를 조합한 결과, 도메인 내 세트에서 BLEU 점수 55.8, 도메인 외 세트에서 16.9를 기록하여 상호 보완적인 성과를 보였다.
- 단일 화자 TTS에서 유래한 합성 데이터로 미세 조정한 결과, 도메인 외 세트에서 성능 저하가 심각하게 발생하여, 합성 데이터의 음성 품질(특히 억양)의 중요성을 입증했다.
- 합성 데이터로 미세 조정하는 동안 사전 훈련된 인코더를 동결하는 것이 과적합을 방지하는 데 매우 중요했으며, 특히 저품질 TTS 시스템을 사용할 경우 더욱 필수적이었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.