[论文解读] Lattice Transformer for Speech Translation
本文提出一种具有可控网格注意力机制的网格变换器(lattice transformer),将标准变换器扩展以处理自动语音识别(ASR)生成的词网格(word lattices),并引入前向、后向及边缘概率得分。该方法在语音翻译与文本翻译任务中均显著提升性能,在LDC西班牙语-英语语料库上相比标准变换器和网格LSTM最高提升1.5 BLEU,在WMT 2017中文-英语语料库上提升0.55 BLEU。
Recent advances in sequence modeling have highlighted the strengths of the transformer architecture, especially in achieving state-of-the-art machine translation results. However, depending on the up-stream systems, e.g., speech recognition, or word segmentation, the input to translation system can vary greatly. The goal of this work is to extend the attention mechanism of the transformer to naturally consume the lattice in addition to the traditional sequential input. We first propose a general lattice transformer for speech translation where the input is the output of the automatic speech recognition (ASR) which contains multiple paths and posterior scores. To leverage the extra information from the lattice structure, we develop a novel controllable lattice attention mechanism to obtain latent representations. On the LDC Spanish-English speech translation corpus, our experiments show that lattice transformer generalizes significantly better and outperforms both a transformer baseline and a lattice LSTM. Additionally, we validate our approach on the WMT 2017 Chinese-English translation task with lattice inputs from different BPE segmentations. In this task, we also observe the improvements over strong baselines.
研究动机与目标
- 将变换器架构扩展以原生处理来自自动语音识别(ASR)的网格结构输入,而非依赖于1-best假设。
- 将ASR网格中的后验概率得分(前向、后向、边缘)整合到注意力机制中,以建模不确定性并提升鲁棒性。
- 开发一种通用框架,可同时处理带有网格输入的语音翻译与文本翻译任务。
- 证明网格感知注意力在低资源与高不确定性场景下优于标准变换器与网格-LSTM。
- 通过验证模型在概率得分不可用时可退化为标准变换器,证明其灵活性。
提出的方法
- 提出一种网格相对位置注意力机制,利用相对位置嵌入编码网格拓扑结构,将注意力限制在共享路径上的词元上。
- 将ASR网格中的前向、后向与边缘概率得分作为可学习注意力权重,实现不确定性感知的注意力计算。
- 设计一种可控注意力机制,根据网格得分动态调整注意力,实现网格信息的灵活融合。
- 改造标准变换器的编码器与解码器,采用网格注意力机制,支持在网格输入上进行端到端训练。
- 在基于子词分词的网格输入下,于语音翻译(LDC西班牙语-英语)与文本翻译(WMT 2017中文-英语)任务上进行训练,使用多个分段生成的BPE网格。
- 通过微调与消融实验,分析各类得分与模块在网格变换器架构中的贡献。
实验结果
研究问题
- RQ1基于变换器的模型能否有效处理来自ASR系统的网格结构输入,而不仅限于1-best假设?
- RQ2ASR网格中的前向、后向与边缘概率得分如何影响注意力计算与翻译性能?
- RQ3与标准变换器及网格-LSTM相比,引入网格结构与不确定性是否能提升翻译质量?
- RQ4该网格变换器能否泛化至使用BPE分词生成的子词网格输入的文本翻译任务?
- RQ5在注意力机制中,不同网格得分(边缘、前向、后向)对最终性能的相对贡献如何?
主要发现
- 在LDC西班牙语-英语语音翻译数据集上,网格变换器相比标准变换器提升1.5 BLEU,相比网格-LSTM提升1.2 BLEU。
- 边缘得分对性能提升贡献最大,编码器与解码器中联合使用时取得最高改进。
- 在WMT 2017中文-英语文本翻译任务中,网格变换器达到24.81 BLEU,超过基线变换器-base(24.26),并以基础参数量达到与更大规模的变换器-big模型(24.20)相当的性能。
- 从网格输入端到端训练收敛更快且性能更优,表明网格结构提供了强大的归纳偏置。
- 模型在文本翻译任务中表现出良好泛化能力,证明BPE分词生成的网格输入即使无语音输入,也能提升翻译质量。
- 注意力可视化结果表明,模型学会关注更可能的网格路径,尤其在模糊或低置信度区域。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。