[论文解读] The USFD Spoken Language Translation System for IWSLT 2014
本论文介绍了谢菲尔德大学(USFD)在 IWSLT 2014 共享任务中提出的口语语言翻译(SLT)系统,该系统结合了两个基于深度神经网络的自动语音识别(ASR)系统与一个短语基于机器翻译(MT)系统。其主要贡献是一种基于质量估计的集成方法,通过预测的翻译性能对 ASR 的 10 个最佳输出进行重打分,相较于主干流水线系统,在英语到法语任务中提升了 0.54 的 BLEU 分数,在英语到德语任务中提升了 0.26 的 BLEU 分数。
The University of Sheffield (USFD) participated in the International Workshop for Spoken Language Translation (IWSLT) in 2014. In this paper, we will introduce the USFD SLT system for IWSLT. Automatic speech recognition (ASR) is achieved by two multi-pass deep neural network systems with adaptation and rescoring techniques. Machine translation (MT) is achieved by a phrase-based system. The USFD primary system incorporates state-of-the-art ASR and MT techniques and gives a BLEU score of 23.45 and 14.75 on the English-to-French and English-to-German speech-to-text translation task with the IWSLT 2014 data. The USFD contrastive systems explore the integration of ASR and MT by using a quality estimation system to rescore the ASR outputs, optimising towards better translation. This gives a further 0.54 and 0.26 BLEU improvement respectively on the IWSLT 2012 and 2014 evaluation data.
研究动机与目标
- 开发一个用于 IWSLT 2014 评估的高性能口语语言翻译系统。
- 通过超越简单流水线的自动语音识别(ASR)与机器翻译(MT)系统集成,提升翻译质量。
- 探究质量估计在重打分 ASR 输出中对提升翻译性能的有效性。
- 利用置信度阈值和基于特征的重打分方法优化系统集成。
提出的方法
- 在 TED 讲座和附加数据上分别训练了两个多轮深度神经网络 ASR 系统(ASR 1 和 ASR 2),使用不同的数据子集和并联特征配置。
- 在领域内 TED 数据以及通过交叉熵差异(CED)准则选择的领域外数据(News Commentary、Common Crawl、Gigaword、Europarl)上训练了短语基于 MT 模型。
- 在 IWSLT 2011 数据的 10 个最佳 ASR 输出上训练了质量估计(QE)模块,使用 117 个 QuEst 特征预测翻译质量。
- QE 模型采用高斯过程与 RBF 核函数,从 117 个特征中筛选出前 58 个,并学习特征与句级 METEOR 分数之间的映射关系。
- 基于预测的翻译质量对 ASR 的 10 个最佳输出进行重打分,仅对低置信度假设应用置信度感知的重打分。
- 集成系统通过重打分提升翻译输出质量,最终的 MT 解码在重打分后的 ASR 假设上执行。
实验结果
研究问题
- RQ1质量估计能否提升口语语言翻译中 ASR 与 MT 系统的集成效果?
- RQ2在 IWSLT 2014 评估数据上,使用预测翻译质量对 ASR N-best 输出进行重打分的效果如何?
- RQ3与对所有假设进行全局重打分相比,置信度感知的重打分是否能带来更好的性能?
- RQ4使用交叉熵差异准则进行数据选择,对领域外 MT 和 ASR 性能有何影响?
- RQ5在 BLEU 和 TER 分数方面,系统集成与标准流水线相比表现如何?
主要发现
- 主干 USFD SLT 系统在 IWSLT 2014 英语到法语测试集上取得了 23.45 的 BLEU 分数,在英语到德语任务上取得了 14.75 的 BLEU 分数。
- 基于 QE 的重打分对比系统在英语到法语任务中使 BLEU 提升了 0.54,在英语到德语任务中提升了 0.26。
- 在 IWSLT 2014 数据上,对 55% 的低置信度句子应用置信度感知重打分,使 BLEU 分数提升了 0.17。
- 在 IWSLT 2012 数据上,置信度感知重打分实现了 0.36 的 BLEU 提升,表明其在低置信度 ASR 输出上更具有效性。
- QE 模块通过高斯过程与 RBF 核函数从 117 个特征中筛选出 58 个,表明语言学特征和模型统计量是翻译质量的强预测因子。
- 单语翻译系统通过恢复大小写和标点符号,实现了在伪 ASR 输出上的 88.0 BLEU 分数和在真实 ASR 输出上的 69.0 BLEU 分数,表明其对 ASR 错误具有较强的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。