[논문 리뷰] SpeechMatrix: A Large-Scale Mined Corpus of Multilingual Speech-to-Speech Translations
이 논문은 유럽 의회 녹음에서 추출한 자료에서 얻은 대규모 다국어 음성-음성 번역 코퍼스인 SpeechMatrix(SM)을 소개한다. 이 코퍼스는 136개의 언어 쌍과 418,000시간의 정렬된 음성 데이터를 포함하며, 단지 추출된 데이터만을 사용하여도 강력한 S2ST 성능을 보여주며, 다국어 학습, 모델 사전학습, Mixture-of-Experts 희소성 등이 다양한 벤치마크에서 번역 품질 향상에 기여함을 입증한다.
We present SpeechMatrix, a large-scale multilingual corpus of speech-to-speech translations mined from real speech of European Parliament recordings. It contains speech alignments in 136 language pairs with a total of 418 thousand hours of speech. To evaluate the quality of this parallel speech, we train bilingual speech-to-speech translation models on mined data only and establish extensive baseline results on EuroParl-ST, VoxPopuli and FLEURS test sets. Enabled by the multilinguality of SpeechMatrix, we also explore multilingual speech-to-speech translation, a topic which was addressed by few other works. We also demonstrate that model pre-training and sparse scaling using Mixture-of-Experts bring large gains to translation performance. The mined data and models are freely available.
연구 동기 및 목표
- 음성-음성 번역(S2ST) 분야에서의 심각한 데이터 부족 문제를 해결하기 위해, 대규모로 자유롭게 이용 가능한 다국어 음성-음성 코퍼스를 구축하기 위해.
- 17개 언어와 136개 언어 쌍에서 추출된 음성 정렬의 품질과 유용성을 평가하기 위해.
- 다국어 S2ST 학습을 탐구하고, 사전학습 및 희소 모델 확장(MoE)을 통한 성능 향상을 입증하기 위해.
- 공통된 다국어 표현을 통해 다국어 S2ST에서 제로샷 및 피처샷 전이 학습을 가능하게 하기 위해.
제안 방법
- Duquenne 등(2021)의 다국어 음성-텍스트 문장 임베딩을 활용하여, 유럽 의회 코퍼스의 17개 언어에서 음성-음성 정렬을 추출하였다.
- 17개 언어에서 다국어 HuBERT 모델을 학습하여, 후속 S2ST 및 음성 합성 모델 학습을 위한 이산 음성 단위를 추출하였다.
- 공통된 인코더-디코더 아키텍처를 가진 시퀀스-투-시퀀스 모델을 사용하여 다국어 음성-음성 번역 파이프라인을 구성하였다.
- GShard와 Base Layer 희소성 기반의 Mixture-of-Experts(MoE)를 적용하여, 추론 비용 증가 없이도 모델 용량을 효율적으로 확장하였다.
- HuBERT, mBART 등의 사전학습 모듈을 사용하여 자원이 적은 환경에서의 초기화 및 일반화 성능을 향상시켰다.
- BLEU 점수를 사용하여 Europarl-ST, VoxPopuli, FLEURS 벤치마크에서 모델 성능을 평가하였으며, 데이터 선택 및 모델 아키텍처에 대한 분석 실험도 실시하였다.
실험 결과
연구 질문
- RQ1다국어 임베딩을 활용하여 단일 언어 음성과 텍스트에서 대규모로 다국어 음성-음성 정렬을 효과적으로 추출할 수 있는가?
- RQ2다국어 S2ST 학습은 이중어 학습 대비 제로샷 및 도메인 내 성능에서 어떻게 비교되는가?
- RQ3모델 사전학습과 Mixture-of-Experts 희소성은 추출된 데이터 기반의 S2ST 성능 향상에 얼마나 기여하는가?
- RQ4사전에 인간이 주석을 달지 않은 병렬 데이터 없이도, 추출된 정렬 품질이 강력한 S2ST 성능을 지원할 수 있는가?
주요 결과
- SpeechMatrix는 136개 언어 쌍에 걸쳐 총 418,000시간의 음성 데이터를 포함하며, 지금까지 공개된 가장 대규모의 다국어 S2ST 코퍼스이다.
- 단지 추출된 데이터로만 학습된 이중어 S2ST 모델이 강력한 성능을 보였으며, 기준 모델 대비 Europarl-ST 및 VoxPopuli 벤치마크에서 평균 +3.8 BLEU 향상되었다.
- XM Transformer 모델을 사용한 다국어 학습은 이중어 학습 대비 Europarl-ST에서 +7.9 BLEU 향상, FLEURS에서 +5.1 BLEU 향상되었다.
- GShard(64개 전문가) 기반의 MoE 희소 확장은 Europarl-ST 셋에서 밀도 모델 대비 평균 +1.0 BLEU 향상되었으며, 도메인 내에서는 더 큰 향상 효과를 보였다.
- MoE-GShard(43억 파라미터)를 적용한 전부-대-영어 다국어 모델은 동일한 FLOPs를 가진 밀도 모델(12억 파라미터) 대비 Europarl-ST에서 +0.9 BLEU, FLEURS에서 +0.2 BLEU 향상되었다.
- 17개 언어로 확장할 경우 도메인 외부 FLEURS에서 성능이 약간 저하됨을 확인하여, 다국어 일반화에서 도메인 이탈 문제의 존재를 시사하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.