[论文解读] MaSS: A Large and Clean Multilingual Corpus of Sentence-aligned Spoken Utterances Extracted from the Bible
本论文介绍了 MaSS,这是一个大规模、多语言、句对齐的语音语料库,包含来自八种语言(巴斯克语、英语、芬兰语、法语、匈牙利语、罗马尼亚语、俄语、西班牙语)的 8,130 个并行口语语句,数据源自 CMU Wilderness 多语言语音数据集。通过应用自动强制对齐与人工评估,作者构建了高质量的语音到语音及语音到文本的对齐结果,展示了其在双语语音检索任务中的实用性,中位排名低至 9,证明了其在低资源和语言类型差异显著的语言对中的可行性。
The CMU Wilderness Multilingual Speech Dataset (Black, 2019) is a newly published multilingual speech dataset based on recorded readings of the New Testament. It provides data to build Automatic Speech Recognition (ASR) and Text-to-Speech (TTS) models for potentially 700 languages. However, the fact that the source content (the Bible) is the same for all the languages is not exploited to date.Therefore, this article proposes to add multilingual links between speech segments in different languages, and shares a large and clean dataset of 8,130 parallel spoken utterances across 8 languages (56 language pairs). We name this corpus MaSS (Multilingual corpus of Sentence-aligned Spoken utterances). The covered languages (Basque, English, Finnish, French, Hungarian, Romanian, Russian and Spanish) allow researches on speech-to-speech alignment as well as on translation for typologically different language pairs. The quality of the final corpus is attested by human evaluation performed on a corpus subset (100 utterances, 8 language pairs). Lastly, we showcase the usefulness of the final product on a bilingual speech retrieval task.
研究动机与目标
- 通过利用 CMU Wilderness 数据集中 700 多种语言共享的源材料(《圣经》),创建一个大规模、高质量的多语言语音语料库。
- 通过提供多样化语言对之间的句对齐并行口语语句,支持语音到语音对齐与翻译研究。
- 通过在 8 种语言对的 100 个代表性语句子集中进行人工评估,确保语料库的质量。
- 通过使用学习到的语音嵌入进行双语语音检索任务,证明该语料库的实用性。
- 发布完整处理流程与对齐数据,以支持向新语言的扩展。
提出的方法
- 作者使用 Kaldi 对八种语言的口语语句与其对应的文本转录进行强制对齐。
- 他们采用带有对比损失函数的孪生神经网络来学习共享的多语言语音嵌入,最小化匹配语句对之间的余弦距离。
- 损失函数定义为 $ L(v_A, v_B, α) = \sum_{v_A,v_B} \Bigg{(} \sum_{v_A^\prime} \max[0, \alpha + d(v_A,v_B) - d(v_A^\prime,v_B)] + \sum_{v_B^\prime} \max[0, \alpha + d(v_A,v_B) - d(v_A,v_B^\prime)] \Bigg{)} $,其中 $ d $ 为余弦距离,$ \alpha $ 为边界值。
- 模型在 8,160 个常用经文上进行训练,分为 80% 训练集、10% 验证集和 10% 测试集,批量大小为 16,共训练 100 个周期。
- 由双语母语者对 100 个语句的子集(8 种语言对)进行人工评估,以评估对齐质量。
- 公开发布处理流程与对齐脚本,以支持通过相同方法向新语言扩展。
实验结果
研究问题
- RQ1自动强制对齐能否从《圣经》等共享源文本中生成高质量、句对齐的多语言语音语料库?
- RQ2自动对齐的质量与语音到语音检索任务中的下游性能之间是否存在相关性?
- RQ3多语言语音嵌入在语言类型差异显著的语言对中,能否有效支持双语语音检索?
- RQ4当人工评估成本较高时,语音到语音检索性能在多大程度上可作为对齐质量的代理指标?
主要发现
- MaSS 语料库包含 8,130 个并行口语语句,涵盖 8 种语言,形成 56 种语言对,具有高质量的句对齐语音到文本及语音到语音对齐。
- 对 100 个语句子集的人工评估平均对齐质量得分为 4.44(满分 5 分),证实了语料库的高可靠性。
- 在语音到语音检索任务中,模型在巴斯克语-英语对中的中位排名为 9,在西班牙语-英语对中为 12,显著优于随机水平(中位排名 408.5)。
- 检索中位排名与人工评估得分之间存在强烈的负相关性(r = -0.76,p < 0.1),表明检索性能可作为对齐质量的代理指标。
- 该方法在语言类型差异较大的语言对中也表现出可行性,例如芬兰语-英语对(中位排名 26)和罗马尼亚语-英语对(中位排名 17)。
- 该处理流程具有可扩展性,公开提供的脚本使得使用相同方法轻松适配新语言成为可能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。