Skip to main content
QUICK REVIEW

[论文解读] LibriVoxDeEn - A Corpus for German-to-English Speech Translation and Speech Recognition

Benjamin Beilharz, Sun Xin|arXiv (Cornell University)|Jan 1, 2019
Natural Language Processing Techniques参考文献 10被引用 13
一句话总结

LibriVoxDeEn 是一个大规模、高质量的德语到英语的语音翻译语料库,包含超过100小时的音频、德语文本以及德语到英语的翻译,均来自德语有声书。该语料库支持端到端的语音翻译与识别,具备高度准确的句子对齐和较低的不连贯性,是迄今为止针对德语到英语任务的最大此类资源。

ABSTRACT

This dataset is a corpus of sentence-aligned triples of German audio, German text, and English translation, based on German audio books. The corpus consists of over 100 hours of audio material and over 50k parallel sentences. The speech data are low in disfluencies because of the audio book setup. The quality of audio and sentence alignments has been checked by a manual evaluation, showing that that speech alignment is in general very high. The sentence alignment quality is comparable to well-used parallel translation data and can be adjusted by cutoffs on the automatic alignment score. To our knowledge, this corpus is to date the largest resource for end-to-end speech translation for German.

研究动机与目标

  • 创建一个大规模、高质量的德语到英语语音翻译与识别平行语料库。
  • 解决在端到端学习范式下,德语缺乏大规模、低不连贯性语音翻译数据集的问题。
  • 通过人工评估和自动评分阈值,确保高句子对齐准确度。
  • 提供一个适合训练和评估端到端语音翻译模型的资源。
  • 通过提供来自有声书的清晰、对齐良好的数据集,支持多语言语音处理研究。

提出的方法

  • 该语料库源自来自LibriVox的公共领域德语有声书。
  • 使用自动对齐工具将音频、德语文本和英语翻译在句子级别进行对齐,并随后进行人工验证。
  • 该数据集包含超过50,000组高质量的平行句子三元组,包含高质量音频和对齐信息。
  • 由于有声书录音的正式朗读风格,不连贯性水平较低。
  • 通过人工评估对对齐质量进行评估,确认其准确度与既有的平行文本数据集相当。
  • 对自动对齐得分应用截断阈值,以过滤低质量对齐,从而提高整体可靠性。

实验结果

研究问题

  • RQ1如何从有声书构建一个大规模、高质量的德语到英语语音翻译语料库?
  • RQ2有声书的音频质量和低不连贯性在多大程度上提升了对齐准确度和模型性能?
  • RQ3该语料库的句子对齐质量与既有的平行文本数据集相比如何?
  • RQ4该语料库能否作为端到端语音翻译与识别模型的可行基准?
  • RQ5自动对齐得分阈值对最终数据集可靠性的影响是什么?

主要发现

  • 该语料库包含超过100小时的德语音频,配以德语文本和英语翻译,形成超过50,000组句子对齐的三元组。
  • 人工评估确认,句子对齐质量非常高,与已建立的平行文本数据集相当。
  • 由于有声书的正式朗读风格,音频数据表现出较低的不连贯性,从而增强了模型训练潜力。
  • 该数据集是迄今为止已知最大的用于端到端德语到英语语音翻译的资源。
  • 自动对齐得分可有效结合截断阈值使用,以提高数据集的可靠性和一致性。
  • 该语料库适用于训练和评估端到端语音翻译与识别系统。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。