Skip to main content
QUICK REVIEW

[论文解读] Europarl-ST: A Multilingual Corpus For Speech Translation Of Parliamentary Debates

Javier Iranzo-Sánchez, Joan Albert Silvestre-Cerdà|arXiv (Cornell University)|Nov 8, 2019
Natural Language Processing Techniques参考文献 24被引用 19
一句话总结

本文介绍了 Europarl-ST,一个从欧洲议会辩论(2008–2012 年)中衍生的公开多语言语音翻译语料库,支持六种欧洲语言之间的 30 个翻译方向。通过采用两阶段过滤流程——说话人分割与基于 CER 的语音识别质量控制——并结合强制声学对齐,该语料库支持高质量的级联 ASR+MT 实验,当在领域内微调 MT 模型时,BLEU 分数最高可提升 +4.0。

ABSTRACT

Current research into spoken language translation (SLT),or speech-to-text translation, is often hampered by the lack of specific data resources for this task, as currently available SLT datasets are restricted to a limited set of language pairs. In this paper we present Europarl-ST, a novel multilingual SLT corpus containing paired audio-text samples for SLT from and into 6 European languages, for a total of 30 different translation directions. This corpus has been compiled using the debates held in the European Parliament in the period between 2008 and 2012. This paper describes the corpus creation process and presents a series of automatic speech recognition, machine translation and spoken language translation experiments that highlight the potential of this new resource. The corpus is released under a Creative Commons license and is freely accessible and downloadable.

研究动机与目标

  • 解决公开可用、多语言语音翻译(SLT)数据集稀缺的问题,特别是针对非英语源语言的语料。
  • 克服现有 SLT 语料库的局限性,这些语料库通常仅限于英语语音与其它语言的翻译配对。
  • 提供一个可复现、自包含且公开可访问的资源,以支持多语言 SLT 以及领域自适应 ASR 和 MT 的研究。
  • 通过源自真实议会会议的统一高质量数据集,支持级联与端到端 SLT 系统的评估与适应。
  • 通过在统一、对齐的语料库中包含德语、法语、西班牙语、意大利语、葡萄牙语和英语,促进低资源语言对的研究。

提出的方法

  • 使用 LinkedEP 数据库获取元数据,从欧洲议会全体会议辩论中收集原始音频以及官方转录/翻译文本。
  • 使用 LIUM SpkDiarization 工具包进行说话人分割,以分离个体说话人片段并减少音频重叠。
  • 利用 TLK 工具包和 FF-DNN 声学模型进行强制声学对齐,从转录文本生成词级时间戳。
  • 基于字符错误率(CER)对语音片段进行过滤,采用语言特定的阈值(德语、法语、西班牙语为 15%;英语为 20%),丢弃质量较低或对齐错误的音频。
  • 使用 40K BPE 子词操作对数据进行预处理,并在域外数据和微调后的 Europarl-ST 数据上训练基于 Transformer 的神经机器翻译(NMT)模型。
  • 通过将微调后的 MT 模型与 ASR 输出结合,评估级联 SLT 系统,使用静音分割和测试集上的 BLEU 评分进行评估。

实验结果

研究问题

  • RQ1能否从公开可用的议会音频和文本数据中构建一个大规模、多语言的 SLT 语料库,并实现高质量的对齐?
  • RQ2与域外模型相比,基于 Europarl-ST 数据对 MT 模型进行领域特定微调,在性能上能提升多少?
  • RQ3基于 CER 的过滤和强制对齐如何影响 SLT 训练数据的质量与可用性?
  • RQ4当使用相同的 ASR 和 MT 组件处理相同数据时,MT 与级联 SLT 系统之间的性能差距有多大?
  • RQ5所提出的过滤流程能否推广到资源有限的其他语言和语音翻译任务中?

主要发现

  • 经过过滤后,最终的 Europarl-ST 语料库包含 44 小时德语、120 小时英语、34 小时西班牙语和 47 小时法语音频,CER 值在 9.1% 到 12.9% 之间。
  • 在 Europarl-ST 数据上微调 MT 模型后,BLEU 分数相比域外模型最高提升 +4.0 分,其中在低资源方向如德语→西班牙语(+2.5 BLEU)中提升最大。
  • 级联 SLT 系统的 BLEU 分数在 15.3 到 28.0 之间,性能最高的为英语→西班牙语(28.0 BLEU),反映出 MT 与 SLT 性能排名之间的强相关性。
  • 过滤流程将初始音频数据减少了高达 70%,但保留了高质量、对齐良好的语音-文本对,适用于训练与评估。
  • 该语料库支持六种语言(德语、英语、西班牙语、法语、意大利语、葡萄牙语)之间的 30 个翻译方向,具备完整的对齐与元数据,是首个公开可用的同类多语言 SLT 资源。
  • 结果证实,基于 Europarl-ST 训练的领域自适应 MT 模型显著优于通用领域模型,证明了在领域内微调对 SLT 的价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。