[论文解读] Fuzzy Alignments in Directed Acyclic Graph for Non-Autoregressive Machine Translation
本文提出在有向无环图中进行模糊对齐(FA-DAG),这是一种非自回归翻译的新颖训练目标,它用所有路径上的模糊n-gram对齐替代了严格的逐标记对齐。通过最大化生成路径与参考翻译之间的期望n-gram重叠,FA-DAG提升了多模态处理能力,增强了生成置信度,并在无需知识蒸馏或束搜索的情况下,仅使用原始数据即达到了新的SOTA性能。
Non-autoregressive translation (NAT) reduces the decoding latency but suffers from performance degradation due to the multi-modality problem. Recently, the structure of directed acyclic graph has achieved great success in NAT, which tackles the multi-modality problem by introducing dependency between vertices. However, training it with negative log-likelihood loss implicitly requires a strict alignment between reference tokens and vertices, weakening its ability to handle multiple translation modalities. In this paper, we hold the view that all paths in the graph are fuzzily aligned with the reference sentence. We do not require the exact alignment but train the model to maximize a fuzzy alignment score between the graph and reference, which takes captured translations in all modalities into account. Extensive experiments on major WMT benchmarks show that our method substantially improves translation performance and increases prediction confidence, setting a new state of the art for NAT on the raw training data.
研究动机与目标
- 解决非自回归翻译(NAT)中因多模态问题导致的性能下降,即单个源句存在多种有效翻译。
- 克服基于有向无环图的NAT模型中负对数似然(NLL)损失的局限性,该损失强制要求参考标记与顶点之间保持严格单调对齐。
- 通过训练模型识别有向无环图中所有路径均与参考文本模糊对齐(而非仅一条精确路径),提升模型校准度与预测置信度。
- 通过确保所有顶点均能从多样化翻译模态中获得非零梯度,从而在更小图尺寸下实现更优性能,使顶点在训练中发挥实质性作用。
- 仅使用原始训练数据,在WMT基准测试中实现SOTA结果,无需依赖知识蒸馏或自回归解码。
提出的方法
- 基于每条有向无环图路径与参考句之间的期望n-gram重叠,引入一种模糊对齐得分,替代严格的点对点对齐。
- 将有向无环图与参考之间的整体对齐得分定义为所有路径上期望模糊对齐得分的期望值,模型训练目标即为最大化该得分。
- 用可微分目标替代标准NLL损失,以鼓励高对齐得分,使模型能够同时从多种翻译模态中学习。
- 使用可微分目标训练基于有向无环图的模型,该目标聚合所有路径的梯度,确保代表多样化翻译变体的顶点得到良好校准。
- 使用可学习的长度预测器,以及顶点表示解码器隐藏状态、边表示转移的图结构,支持基于路径的解码。
- 在推理阶段应用前瞻解码,以利用模糊训练目标带来的更高置信度与对齐性,生成高质量输出。
实验结果
研究问题
- RQ1是否一种考虑有向无环图中所有路径的模糊对齐目标,能够改善非自回归翻译中的多模态处理?
- RQ2与基于NLL的训练相比,用模糊对齐目标替代严格NLL损失,是否能带来更好的性能与更高的预测置信度?
- RQ3FA-DAG在不依赖知识蒸馏或束搜索的情况下,能在多大程度上实现原始训练数据上的SOTA性能?
- RQ4与基线DA-Transformer相比,图大小如何影响FA-DAG的性能?
- RQ5模糊对齐目标是否能降低模型困惑度,并改善在多样化翻译模态下顶点的校准度?
主要发现
- FA-DAG在仅使用原始训练数据的情况下,于WMT14 En-De与WMT16 En-De基准上实现了新的SOTA性能,优于以往的NAT模型。
- 在WMT14 En-De上,FA-DAG在λ=3时达到26.47 BLEU,与DA-Transformer在λ=8时的性能相当,表明其在图尺寸使用上具有更高的效率。
- 模型提升了预测置信度,表现为顶点通过概率在0或1附近聚集,且标记概率接近1,表明校准性更优。
- 在所有图尺寸(λ=2至λ=8)下,FA-DAG平均比DA-Transformer基线高出0.96 BLEU,证明了其鲁棒性与有效性。
- 模糊对齐目标使更多梯度有效传递至捕捉替代翻译的顶点,而NLL损失仅校准严格对齐的路径。
- 实验结果证实,FA-DAG降低了困惑度,并避免了NAT模型中常见的重复标记问题,归因于更优的多模态建模能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。