Skip to main content
QUICK REVIEW

[论文解读] ON-TRAC Consortium End-to-End Speech Translation Systems for the IWSLT 2019 Shared Task

Ha-Thanh Nguyen, Natalia Tomashenko|arXiv (Cornell University)|Oct 30, 2019
Natural Language Processing Techniques被引用 5
一句话总结

本论文介绍了ON-TRAC联盟为IWSLT 2019共享任务开发的端到端语音翻译系统,采用单一神经编码器-解码器架构与注意力机制实现英语到葡萄牙语的翻译。最佳模型在MuST-C上取得26.91的BLEU分数,在How2上取得43.82的BLEU分数,分别优于流水线ASR+MT基线4.77分和9.59分,使用合并训练数据与字符级分词策略可获得最佳结果。

ABSTRACT

This paper describes the ON-TRAC Consortium translation systems developed for the end-to-end model task of IWSLT Evaluation 2019 for the English-to-Portuguese language pair. ON-TRAC Consortium is composed of researchers from three French academic laboratories: LIA (Avignon Universit\\'e), LIG (Universit\\'e Grenoble Alpes), and LIUM (Le Mans Universit\\'e). A single end-to-end model built as a neural encoder-decoder architecture with attention mechanism was used for two primary submissions corresponding to the two EN-PT evaluations sets: (1) TED (MuST-C) and (2) How2. In this paper, we notably investigate impact of pooling heterogeneous corpora for training, impact of target tokenization (characters or BPEs), impact of speech input segmentation and we also compare our best end-to-end model (BLEU of 26.91 on MuST-C and 43.82 on How2 validation sets) to a pipeline (ASR+MT) approach.

研究动机与目标

  • 为IWSLT 2019共享任务开发并评估英语到葡萄牙语的端到端语音翻译系统。
  • 研究混合异构语音翻译语料库(MuST-C与How2)对模型性能的影响。
  • 比较不同目标侧分词策略(字符与BPE)对翻译质量的影响。
  • 评估基于ASR与基于说话人区分的语音输入分割方法的有效性。
  • 评估微调与端到端训练是否优于标准流水线ASR+MT方法。

提出的方法

  • 所有提交均采用单一端到端神经编码器-解码器模型,配备注意力机制。
  • 将MuST-C与How2的训练数据合并,形成总时长达674.4小时的合并语料库。
  • 使用基于静音的ASR系统对语音输入进行分割(静音阈值0.65秒,长段落时降低至0.15秒)。
  • 对目标侧分词策略进行评估,采用字符级与不同词汇量(400–8000)的BPE单位。
  • 对在How2数据集上表现最佳的模型应用微调,采用全模型与仅解码器微调两种策略。
  • 构建了基于独立ASR与NMT系统的流水线基线,采用BPE-30k分词。

实验结果

研究问题

  • RQ1合并异构语料库(How2与MuST-C)是否能提升端到端语音翻译性能?
  • RQ2哪种目标侧分词单位表现更优:字符还是子词单位(BPE)?
  • RQ3语音输入分割的最佳方法是什么:基于ASR的分割还是基于说话人区分的分割?
  • RQ4微调是否能提升端到端模型的性能?
  • RQ5端到端模型是否优于标准的ASR+MT流水线方法?

主要发现

  • 合并MuST-C与How2语料库显著提升了性能,在MuST-C tst-COMMON集上BLEU得分为26.91,在How2验证集上为42.97。
  • 字符级分词在MuST-C上表现最佳,BLEU得分为26.91;而BPE-400在How2上取得最高分(43.82)。
  • 基于ASR的语音分割优于基于说话人区分的分割,其分段时长分布更接近训练数据,且BLEU得分更高。
  • 在How2数据集上对模型进行微调后,性能略有提升但无统计显著性,验证集上得分分别为43.02(未冻结)与43.04(冻结)。
  • 尽管未对ASR与MT组件进行联合优化,端到端模型在MuST-C上仍比流水线ASR+MT基线高出4.77 BLEU分,在How2上高出9.59 BLEU分。
  • 表现最佳的端到端模型在MuST-C上取得26.91的大小写敏感BLEU分数,在How2上取得43.82的BLEU分数,后者结果为在评估截止日期后使用BPE-400获得。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。