[论文解读] CoVoST: A Diverse Multilingual Speech-To-Text Translation Corpus
CoVoST 是一个包含 708 小时多语言语音转文字翻译语料库,涵盖 11 种语言(例如法语、德语、西班牙语)转英语,包含超过 11,000 名说话人和 60 多种口音。本文提出了首个端到端多对一多语言语音翻译模型,通过多语言训练在高资源和中等资源语言上实现了性能提升,结合法语时在法语上的 BLEU 得分达到 13.38,在中文上的 BLEU 得分为 4.71。
Spoken language translation has recently witnessed a resurgence in popularity, thanks to the development of end-to-end models and the creation of new corpora, such as Augmented LibriSpeech and MuST-C. Existing datasets involve language pairs with English as a source language, involve very specific domains or are low resource. We introduce CoVoST, a multilingual speech-to-text translation corpus from 11 languages into English, diversified with over 11,000 speakers and over 60 accents. We describe the dataset creation methodology and provide empirical evidence of the quality of the data. We also provide initial benchmarks, including, to our knowledge, the first end-to-end many-to-one multilingual models for spoken language translation. CoVoST is released under CC0 license and free to use. We also provide additional evaluation data derived from Tatoeba under CC licenses.
研究动机与目标
- 解决缺乏多样化、大规模多语言语音转文字翻译数据集的问题,这些数据集包含多个说话人和口音。
- 通过提供超越以英语为中心或领域特定的数据集的高资源、多样化语料库,推动端到端多语言语音翻译研究。
- 为多对一多语言语音翻译建立基线模型,这是端到端框架中此前未被探索的设置。
- 通过引入基于转录文本分组的多说话人评估指标,评估模型在说话人差异下的鲁棒性。
提出的方法
- 从 Common Voice 数据中构建 CoVoST,通过源语音与目标文本翻译之间的句子级对齐。
- 从 Tatoeba 收集额外的评估数据,确保多样化的、域外的测试集以实现稳健评估。
- 通过按转录文本分组测试样本,设计多说话人评估协议,并计算平均 BLEU 和变异系数以评估模型稳定性。
- 使用 CoVoST 训练集的分组,为双语和多语言设置训练端到端序列到序列模型。
- 引入一种新颖的评估指标 BLEU_MS,通过归一化多个说话人转录文本的性能;以及 CoefVar_MS 用于衡量模型方差。
- 提供基线模型,包括首个已知的端到端多对一多语言 ST 模型,仅使用监督数据进行训练。
实验结果
研究问题
- RQ1多语言训练是否能提升包括低资源语言和远距离语言对在内的多种语言的语音转文字翻译性能?
- RQ2在翻译相同内容时,模型性能在不同说话人和口音之间如何变化?
- RQ3将多种源语言结合对高资源目标语言(如法语和德语)的翻译质量有何影响?
- RQ4端到端多语言 ST 模型在不同说话人特征(如性别、年龄、口音)下的稳定性如何?
- RQ5在单一模型中包含多种语言是否能提升泛化能力并增强对说话人差异的鲁棒性?
主要发现
- CoVoST 语料库包含 11 种语言的多语言语音转文字翻译数据,总计 708 小时,其中法语和德语在公开语料库中拥有最长的时长。
- 结合多种源语言的多语言模型在高资源语言(如法语,BLEU 得分为 13.38;德语,BLEU 得分为 3.3)上持续提升了 BLEU 得分,即使在远距离语言对(如俄语和法语)中也观察到性能增益。
- 增加多种语言(如 De+Fr 或 Zh+Fr)后,BLEU_MS 得分分别提升至 10.06 和 12.65,表明在多样化说话人中平均性能更优。
- 模型稳定性(以 CoefVar_MS 衡量)在说话人多样性高但训练数据有限的语言中最低——德语和波斯语的不稳定性最高(CoefVar_MS 分别为 2.12 和 0.67)。
- 变异系数指标显示,多语言模型在不同语言组合下保持了相近的稳定性(CoefVar_MS ≈ 0.8–1.2),表明对说话人差异具有鲁棒性。
- CoVoST 数据集和基线模型已以 CC0 和 CC 许可公开发布,支持社区广泛使用并推动多语言语音翻译的进一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。