[论文解读] The USTC-NEL Speech Translation system at IWSLT 2018
该论文提出了一种来自USTC-NEL的混合式流水线语音翻译系统,通过在自动语音识别(ASR)输出上直接训练神经机器翻译(NMT)模型,并结合数据增强技术,避免了文本归一化,从而提升了翻译性能。该系统在IWSLT 2018基准上相较于KIT基线模型实现了14.9的BLEU提升,通过利用ASR生成的文本进行NMT训练,并结合增强数据与句子重分割,优于采用文本归一化的标准流水线系统以及端到端模型。
This paper describes the USTC-NEL system to the speech translation task of the IWSLT Evaluation 2018. The system is a conventional pipeline system which contains 3 modules: speech recognition, post-processing and machine translation. We train a group of hybrid-HMM models for our speech recognition, and for machine translation we train transformer based neural machine translation models with speech recognition output style text as input. Experiments conducted on the IWSLT 2018 task indicate that, compared to baseline system from KIT, our system achieved 14.9 BLEU improvement.
研究动机与目标
- 为解决传统语音翻译流水线中误差累积的问题,通过改善ASR与机器翻译组件之间的对齐。
- 探究在不进行文本归一化的情况下,直接在原始ASR输出上训练NMT模型是否能提升性能。
- 评估数据增强与句子重分割在提升语音翻译质量方面的有效性。
- 对比采用数据增强NMT的流水线系统与端到端语音翻译模型的性能。
- 在IWSLT 2018语音翻译基准上实现最先进性能。
提出的方法
- 系统采用基于HMM的混合模型,结合CNN与LSTM架构,利用强制对齐与置信度过滤,在TED-LIUM2和IWSLT数据上进行训练。
- 未标注音频(166小时)通过初始ASR模型转录,并依据置信度进行过滤,以扩展训练数据。
- 通过噪声注入与速度扰动(因子0.8与1.2)实施数据增强,使有效训练数据增至约2,100小时。
- 使用Transformer架构在ASR输出上训练神经机器翻译模型,结合WMT 2018的单语数据与领域自适应过滤。
- 在ASR后处理阶段应用句子重分割,通过将长句划分为语义连贯的片段以提升翻译质量。
- 采用模型集成解码策略,结合多个模型(自左向右、自右向左、文本归一化与端到端模型)的假设,并通过语言模型与NMT模型进行重评分。
实验结果
研究问题
- RQ1在不进行文本归一化的情况下,直接在原始ASR输出上训练NMT模型是否能提升语音翻译性能?
- RQ2对ASR输出进行数据增强如何影响端到端与流水线语音翻译系统的性能?
- RQ3基于ASR输出的句子重分割是否优于基于VAD的分割方式,能提升翻译质量?
- RQ4在IWSLT 2018上,采用数据增强的流水线系统性能与端到端语音翻译模型相比如何?
- RQ5通过多样化解码策略与重评分的模型集成是否能显著提升BLEU分数?
主要发现
- 所提出的基于数据增强的流水线系统在IWSLT 2018测试集上实现了平均30.26的BLEU分数,相较于KIT基线(15.32)提升了14.9 BLEU。
- 采用句子重分割与数据增强的系统(平均BLEU 28.76)优于采用文本归一化的系统(平均BLEU 27.41)。
- 最佳集成系统结合了多个模型并利用语言模型与端到端模型进行重评分,实现了30.26的平均BLEU,显著优于端到端系统(21.52 BLEU)。
- 在原始ASR输出上训练的数据增强NMT模型实现了28.76 BLEU,比采用文本归一化与句子重分割的系统高出1.3 BLEU。
- 同时采用句子重分割与数据增强的系统在tst2010上达到28.98 BLEU,tst2013上达到30.69 BLEU,tst2015上达到25.99 BLEU,显示出在各测试集上的一致性增益。
- 最终主系统(30.26 BLEU)超越了对比用的端到端系统(21.52 BLEU),证明在该基准上,结合数据增强的流水线系统仍优于端到端模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。