[论文解读] Neural Lattice-to-Sequence Models for Uncertain Inputs
本文提出一种神经网格到序列模型,通过将词网格后验得分整合到基于TreeLSTM的编码器和注意力机制中,提升序列到序列的翻译性能。通过根据网格置信度得分对隐藏状态和注意力进行加权,该模型在基线模型(使用1-best转录或未加权网格)的基础上实现了稳定提升——在Fisher数据集上提升1.4 BLEU,在Callhome数据集上提升0.8 BLEU。
The input to a neural sequence-to-sequence model is often determined by an up-stream system, e.g. a word segmenter, part of speech tagger, or speech recognizer. These up-stream models are potentially error-prone. Representing inputs through word lattices allows making this uncertainty explicit by capturing alternative sequences and their posterior probabilities in a compact form. In this work, we extend the TreeLSTM (Tai et al., 2015) into a LatticeLSTM that is able to consume word lattices, and can be used as encoder in an attentional encoder-decoder model. We integrate lattice posterior scores into this architecture by extending the TreeLSTM's child-sum and forget gates and introducing a bias term into the attention mechanism. We experiment with speech translation lattices and report consistent improvements over baselines that translate either the 1-best hypothesis or the lattice without posterior scores.
研究动机与目标
- 为解决来自错误率较高的上游系统(如自动语音识别器)的不确定输入翻译挑战。
- 通过显式建模词网格后验得分中的不确定性,改进神经序列到序列模型。
- 开发一种网格感知编码器,其泛化自序列编码器,并通过预训练实现更好的训练收敛性。
- 探究网格得分对注意力、子节点求和和遗忘门的影响,以提升翻译鲁棒性。
提出的方法
- 将TreeLSTM扩展为LatticeLSTM,通过基于多个前驱路径及其关联后验概率来条件化隐藏状态,以处理词网格。
- 引入加权子节点求和计算,其中隐藏状态作为前驱节点的加权平均值计算,权重来源于网格后验得分。
- 修改TreeLSTM遗忘门,使其对低概率前驱路径更具遗忘性,从而降低不确定路径的影响。
- 通过可学习的尖锐度系数,使注意力机制更关注高置信度网格节点的源嵌入表示。
- 在微调前,先在序列数据上对模型进行预训练,以加速收敛并提升性能。
- 采用可学习的尖锐度参数,动态调整注意力和门控机制对网格得分的敏感度。
实验结果
研究问题
- RQ1是否能够证明,结合词网格后验得分的网格到序列模型,在语音翻译任务中优于仅使用1-best假设或未加权网格的模型?
- RQ2不同的集成策略(加权子节点求和、偏置遗忘门、注意力偏置)对模型性能的贡献如何?
- RQ3在序列数据上进行预训练是否能提升在网格数据上微调时的收敛速度和最终性能?
- RQ4网格得分的可靠性如何影响在不同ASR词错误率下的模型增益?
- RQ5在训练阶段集成网格得分是否比在推理阶段集成或完全不使用得分更有效?
主要发现
- 所提出的结合网格得分注意力偏置的网格到序列模型,在Fisher语音翻译语料库上相比强基线1-best模型,BLEU分数提升1.4分。
- 在Callhome西班牙语-英语语料库上,该模型相比1-best基线提升0.8 BLEU分,且在仅使用有限网格数据进行微调时,增益依然保持稳定。
- 注意力机制对网格得分的集成是最具影响力的组件,其改进效果始终优于对子节点求和和遗忘门的修改。
- 采用可学习尖锐度系数训练的模型收敛稳定,注意力和门控组件的平均值为0.92–1.0,表明对得分可靠性具有鲁棒性。
- 网格得分在中等词错误率下最为有益;当词错误率极高时,其影响减弱,可能由于得分可靠性下降。
- 即使没有后验得分的网格也优于1-best输入,但后验得分的引入对于最大化性能增益至关重要,尤其是在低资源设置下。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。