[논문 리뷰] CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus
CoVoST는 11개 언어(예: 프랑스어, 독일어, 스페인어)에서 영어로의 708시간 분량의 음성 데이터를 포함한 다국어 음성-텍스트 번역 코퍼스로, 11,000명 이상의 화자와 60개 이상의 억양을 수록하고 있다. 본 논문은 첫 번째 엔드 투 엔드 다대일 다국어 음성 번역 모델을 제안하며, 다국어 학습을 통해 고자원 및 중자원 언어에서 성능 향상을 입증하였고, 프랑스어에서는 BLEU 점수가 13.38, 중국어에서는 4.71에 도달하였다.
Spoken language translation has recently witnessed a resurgence in popularity, thanks to the development of end-to-end models and the creation of new corpora, such as Augmented LibriSpeech and MuST-C. Existing datasets involve language pairs with English as a source language, involve very specific domains or are low resource. We introduce CoVoST, a multilingual speech-to-text translation corpus from 11 languages into English, diversified with over 11,000 speakers and over 60 accents. We describe the dataset creation methodology and provide empirical evidence of the quality of the data. We also provide initial benchmarks, including, to our knowledge, the first end-to-end many-to-one multilingual models for spoken language translation. CoVoST is released under CC0 license and free to use. We also provide additional evaluation data derived from Tatoeba under CC licenses.
연구 동기 및 목표
- 다양하고 대규모의 다국어 음성-텍스트 번역 데이터셋이 화자 및 억양의 다양성을 포함하지 못하는 문제를 해결하기 위해.
- 영어 중심 또는 영역 특화 데이터셋을 초월하여, 다국어 음성 번역 연구를 가능하게 하는 고자원, 다양한 코퍼스를 제공하기 위해.
- 이전에 엔드 투 엔드 프레임워크에서 다루지 않은 바이어스 없는 다대일 다국어 음성 번역 설정을 위한 기준 모델을 수립하기 위해.
- 화자 다양성에 따른 모델의 강인성을 평가하기 위해, 전사 수준 그룹화 기반의 다중 화자 평가 지표를 도입하기 위해.
제안 방법
- 공통 음성(Common Voice) 데이터에서 CoVoST를 구축하였으며, 원천 음성과 목표 텍스트 번역 간 문장 수준의 정렬을 사용하였다.
- Tatoeba로부터 추가 평가 데이터를 확보하여, 모델의 강인한 평가를 위한 다양한, 도메인 외부의 테스트 세트를 확보하였다.
- 테스트 샘플을 전사문 기준으로 그룹화하여 다중 화자 평가 프로토콜을 설계하였으며, 평균 BLEU 점수와 분산 계수를 계산하여 모델의 안정성 평가를 수행하였다.
- CoVoST 훈련 세트를 사용하여 이중어 및 다국어 설정 모두에서 엔드 투 엔드 시퀀스-투-시퀀스 모델을 훈련시켰다.
- 다양한 화자에 걸쳐 성능을 정규화하는 데 사용되는 새로운 평가 지표인 BLEU_MS를 도입하였으며, 모델 변동성을 측정하기 위해 CoefVar_MS도 제안하였다.
- 초기 모델을 제공하였으며, 이는 감독 학습 데이터만을 사용하여 훈련된, 알려진 바이어스 없는 다대일 다국어 ST 모델의 첫 번째 사례이다.
실험 결과
연구 질문
- RQ1다국어 학습이 저자원 언어나 거리가 먼 언어 쌍을 포함한 다양한 언어에서 음성-텍스트 번역 성능을 향상시킬 수 있는가?
- RQ2동일한 내용을 번역할 때, 다양한 화자와 억양에서 모델 성능은 어떻게 달라지는가?
- RQ3여러 원천 언어를 결합함으로써 프랑스어나 독일어와 같은 고자원 목표 언어의 번역 품질에 어떤 영향을 미치는가?
- RQ4성별, 연령, 억양 등의 다양한 화자 특성에 대해 엔드 투 엔드 다국어 ST 모델의 안정성은 어떻게 되는가?
- RQ5단일 모델에 여러 언어를 포함시키는 것이 일반화 능력과 화자 다양성에 대한 강인성을 향상시키는가?
주요 결과
- CoVoST 코퍼스는 11개 언어에서 708시간 분량의 다국어 음성-텍스트 번역 데이터를 포함하며, 공개 데이터셋 중에서 프랑스어와 독일어가 가장 긴 기간을 기록하고 있다.
- 다국어 모델이 다수의 원천 언어를 결합함으로써 고자원 언어인 프랑스어(13.38 BLEU)와 독일어(3.3 BLEU)에서 BLEU 점수를 지속적으로 향상시켰으며, 러시아어와 프랑스어와 같은 거리가 먼 언어 쌍에서도 성능 향상이 관찰되었다.
- 독일어+프랑스어 또는 중국어+프랑스어와 같이 다국어를 추가함으로써 BLEU_MS 점수는 각각 10.06과 12.65로 향상되었으며, 이는 다양한 화자에 걸친 평균 성능 향상을 시사한다.
- CoefVar_MS로 측정한 모델 안정성은 화자 다양성이 높고 훈련 데이터가 제한된 언어에서 가장 낮았으며, 독일어와 페르시아어는 각각 2.12와 0.67로 가장 높은 불안정성을 보였다.
- 분산 계수 지표는 다국어 모델이 다양한 언어 조합 간에 유사한 안정성(CoefVar_MS ≈ 0.8–1.2)을 유지함을 보여주었으며, 이는 화자 다양성에 대한 강인성을 시사한다.
- CoVoST 데이터셋과 기준 모델은 CC0 및 CC 라이선스 하에 공개되어 있으며, 다국어 음성 번역 분야의 광범위한 공동 연구 및 향후 연구를 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.