[论文解读] LibriVoxDeEn: A Corpus for German-to-English Speech Translation and German Speech Recognition
本论文介绍了 LibriVoxDeEn,这是一个大规模平行语料库,包含110小时的德语语音、德语文本以及对应的英文翻译,源自公共领域的德语有声读物,支持端到端的德语到英语语音翻译。此外,还提供了547小时与文本对齐的德语语音,用于德语语音识别。人工评估证实了高质量的语音-文本对齐和文本-文本对齐,且可通过自动评分阈值调节对齐可靠性。
We present a corpus of sentence-aligned triples of German audio, German text, and English translation, based on German audiobooks. The speech translation data consist of 110 hours of audio material aligned to over 50k parallel sentences. An even larger dataset comprising 547 hours of German speech aligned to German text is available for speech recognition. The audio data is read speech and thus low in disfluencies. The quality of audio and sentence alignments has been checked by a manual evaluation, showing that speech alignment quality is in general very high. The sentence alignment quality is comparable to well-used parallel translation data and can be adjusted by cutoffs on the automatic alignment score. To our knowledge, this corpus is to date the largest resource for German speech recognition and for end-to-end German-to-English speech translation.
研究动机与目标
- 解决德语到英语语音翻译及德语语音识别领域大规模、高质量平行语料库稀缺的问题。
- 提供一种支持端到端神经语音翻译的资源,避免流水线系统中的错误传播。
- 通过使用公共领域有声读物中的朗读语音,创建具有最少不流畅现象的语料库。
- 通过自动化工具与人工评估确保高对齐质量,使基于对齐置信度分数的可靠过滤成为可能。
- 提供迄今为止最大的德语语音识别与德语到英语语音翻译资源。
提出的方法
- 通过使用 BeautifulSoup4 和 Scrapy 的网络爬虫,从 LibriVox、Project Gutenberg 和 archive.org 收集德语有声读物及其对应的公共领域文本。
- 通过去除噪声、过滤前后缀以及使用 spaCy 进行句子分割,对语音和文本数据进行预处理。
- 使用强制对齐工具 aeneas 进行语音到文本的对齐,利用 SoX 根据时间戳分割音频。
- 使用 hunalign 通过词典匹配和句长启发式方法生成德语-英语句子对齐。
- 利用 hunalign 置信度分数对句子对进行过滤,以提升对齐质量,实现基于阈值的语料库优化。
- 通过 Krippendorff’s alpha 进行人工评估,以评估标注者间的一致性与对齐质量。
实验结果
研究问题
- RQ1能否从公共领域的有声读物中构建一个大规模、高质量的德语语音、德语文本与英文翻译的平行语料库?
- RQ2自动对齐工具(aeneas、hunalign)在生成语音翻译与语音识别任务中的可靠语音-文本对齐与文本-文本对齐方面效果如何?
- RQ3对齐置信度分数(如 hunalign 分数)在过滤和提升平行句子对质量方面的适用程度如何?
- RQ4该语料库的对齐质量与语音翻译和语音识别领域既有的基准相比如何?
- RQ5该语料库能否作为训练端到端语音翻译与自动语音识别模型在德语中的可行替代品,相较于更小或更嘈杂的数据集?
主要发现
- 该语料库包含110小时与超过50,000组平行句子对(德语文本与英文翻译)对齐的德语语音,是迄今为止最大的用于端到端德语到英语语音翻译的可用资源。
- 额外提供了547小时与德语文本对齐的德语语音,构成目前最大的德语语音识别语料库。
- 人工评估显示,语音-文本对齐的标注者间一致性接近完美(Krippendorff’s α = 1.00),文本-文本对齐也表现出显著一致性(α = 0.77)。
- 文本-文本对齐质量与 hunalign 置信度分数高度相关,表明可通过阈值过滤实现有效筛选。
- 由于使用了有声读物中的朗读语音,语音-文本对齐整体质量极高,不流畅现象极少。
- 该语料库的对齐质量与公认的高质量平行语料库相当,支持其在训练鲁棒的端到端模型中的应用。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。