[论文解读] Neural Machine Translation with Dynamic Graph Convolutional Decoder
本文提出了一种新颖的端到端神经机器翻译框架 Dyn-STGCD,该框架以自回归方式联合生成目标翻译及其句法依存图。通过在解码过程中使用定制的图卷积解码器动态构建目标句法图,该模型在多个基准测试中提升了翻译性能,在 WMT 2014 英德和英法任务上分别取得了 28.1 和 41.8 的 BLEU 分数,达到当前最优水平。
Existing wisdom demonstrates the significance of syntactic knowledge for the improvement of neural machine translation models. However, most previous works merely focus on leveraging the source syntax in the well-known encoder-decoder framework. In sharp contrast, this paper proposes an end-to-end translation architecture from the (graph \& sequence) structural inputs to the (graph \& sequence) outputs, where the target translation and its corresponding syntactic graph are jointly modeled and generated. We propose a customized Dynamic Spatial-Temporal Graph Convolutional Decoder (Dyn-STGCD), which is designed for consuming source feature representations and their syntactic graph, and auto-regressively generating the target syntactic graph and tokens simultaneously. We conduct extensive experiments on five widely acknowledged translation benchmarks, verifying that our proposal achieves consistent improvements over baselines and other syntax-aware variants.
研究动机与目标
- 为解决神经机器翻译中目标端显式句法结构建模的不足。
- 使解码器能够在自回归生成过程中动态构建并利用目标端句法图。
- 通过联合建模目标词元及其句法依赖关系来提升翻译质量。
- 证明显式的目标端句法建模可超越仅使用源端句法的模型,显著提升翻译性能。
- 提供一种可泛化的图到图生成框架,适用于其他序列到图的任务。
提出的方法
- 提出一种动态空间-时序图卷积解码器(Dyn-STGCD),用于处理源词元表示及其句法图。
- 引入一种动态图构建机制,即在每个解码步骤中逐步添加新节点(预测的词元)和边。
- 采用空间-时序 GCN 层,以建模目标图中的局部邻域信息与序列依赖关系。
- 使用基于 Transformer 的编码器,从源句及其句法图中提取上下文表示。
- 设计一种联合生成目标,同时优化目标词元预测与句法图结构的联合目标函数。
- 利用独立的依存解析器生成伪参考图,用于评估预测句法结构的一致性。
实验结果
研究问题
- RQ1显式建模目标端句法结构是否能提升神经机器翻译的性能?
- RQ2能否在自回归解码过程中,通过图卷积层动态构建句法图?
- RQ3与仅使用源端句法的模型相比,联合生成目标词元及其句法图的效果如何?
- RQ4预测的句法图与外部解析器生成的黄金标准解析结果在多大程度上一致?
- RQ5所提出的 Dyn-STGCD 框架是否可泛化到翻译以外的其他序列到图生成任务?
主要发现
- 在 WMT 2014 英德翻译任务中,Dyn-STGCD 达到 28.1 的 BLEU 分数,优于基线 Transformer 及其他句法感知模型。
- 在英法任务中,Dyn-STGCD 达到 41.8 的 BLEU 分数,超过基线 Transformer(41.0)及其他句法感知变体。
- 该模型生成的句法图与独立依存解析器的输出高度一致,表明其结构预测具有可靠性。
- 在 NIST 中英和 WMT 基准上的实证结果表明,该方法在多个基线和句法感知模型上均实现持续改进。
- 该方法在不使用模型集成或复合拆分等常见性能增强技术的情况下,显著提升了翻译质量。
- 动态图构建机制使解码器能够自适应地在生成过程中整合句法信息,从而实现更优的上下文建模。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。