[论文解读] CoVoST 2: A Massively Multilingual Speech-to-Text Translation Corpus
CoVoST 2 是一个大规模、开源的多语言语音转文本翻译语料库,涵盖 21 种源语言到英语以及英语到 15 种目标语言的翻译任务,是迄今为止规模最大的此类数据集。它支持在多种语言对之间进行大规模的语音翻译模型训练与评估,数据质量通过合理性检查得到验证,并以 CC0 许可证发布。
Speech translation has recently become an increasingly popular topic of research, partly due to the development of benchmark datasets. Nevertheless, current datasets cover a limited number of languages. With the aim to foster research in massive multilingual speech translation and speech translation for low resource language pairs, we release CoVoST 2, a large-scale multilingual speech translation corpus covering translations from 21 languages into English and from English into 15 languages. This represents the largest open dataset available to date from total volume and language coverage perspective. Data sanity checks provide evidence about the quality of the data, which is released under CC0 license. We also provide extensive speech recognition, bilingual and multilingual machine translation and speech translation baselines.
研究动机与目标
- 为解决大规模、多语言语音转文本翻译数据集稀缺的问题,特别是针对低资源语言对的问题。
- 通过提供广泛的语言覆盖和大量数据,支持大规模多语言语音翻译研究。
- 通过多样化的多语言数据,提升模型在不同语言类型和语音特征变化下的泛化能力和性能。
- 支持在多个语言对之间对语音识别、机器翻译和端到端语音翻译模型进行基准测试。
提出的方法
- 该数据集基于现有的多语言语音和文本资源构建,包括 Common Voice 和 OPUS 数据集,并使用强制对齐技术自动对齐音频与文本。
- 通过自动化的数据合理性检查对音频与文本对进行筛选和整理,以确保数据质量和一致性。
- 语料库包含 21 种源语言到英语以及 15 种英语到目标语言的平行数据,覆盖广泛的语言多样性。
- 基于该数据集训练了语音识别、双语和多语言机器翻译以及端到端语音翻译的基线模型。
- 该数据集以 CC0 许可证发布,以最大程度提高其在研究中的可访问性和可重用性。
- 建立了评估协议和指标,以支持语音翻译、翻译和 ASR 任务之间的一致性基准测试。
实验结果
研究问题
- RQ1在大规模多语言设置下,语音翻译模型在高资源与低资源语言对之间的性能表现有何差异?
- RQ2在 CoVoST 2 上进行多语言预训练在多大程度上能提升对未见语言对的零样本迁移性能?
- RQ3在 CoVoST 2 上训练的多语言语音翻译模型能否在不同语言类型和语音结构之间实现有效泛化?
- RQ4包含 21 种源语言和 15 种目标语言如何影响端到端语音翻译系统的可扩展性和效率?
- RQ5在构建大规模、开放的多语言语音翻译语料库时,关键的质量与覆盖范围之间的权衡是什么?
主要发现
- CoVoST 2 是目前公开可用的最大规模多语言语音转文本翻译数据集,全面覆盖 21 种源语言到英语以及 15 种英语到目标语言的语料对。
- 数据合理性检查确认了音频与文本之间高质量的对齐,支持可靠的模型训练与评估。
- 该数据集支持在多种语言对(包括低资源组合)上训练强大的多语言语音翻译基线模型。
- 语音识别、机器翻译和语音翻译的基线模型表现具有竞争力,证明了该数据集在基准测试中的实用性。
- 以 CC0 许可证发布数据集,促进了多语言语音翻译研究中广泛的应用与可复现性。
- 广泛的语言覆盖支持开发在语言对之间具备更强零样本和少样本泛化能力的模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。