Skip to main content
QUICK REVIEW

[论文解读] Non-Autoregressive Translation by Learning Target Categorical Codes

Yu Bao, Shujian Huang|arXiv (Cornell University)|Mar 21, 2021
Natural Language Processing Techniques参考文献 24被引用 4
一句话总结

本文提出CNAT,一种非自回归Transformer模型,通过向量量化和条件随机场(CRF)学习隐式类别编码,以建模目标序列中的依赖关系,显著提升翻译质量。该方法在无需知识蒸馏的情况下实现最先进性能,BLEU得分与强基线模型相当或更优,同时保持高推理速度。

ABSTRACT

Non-autoregressive Transformer is a promising text generation model. However, current non-autoregressive models still fall behind their autoregressive counterparts in translation quality. We attribute this accuracy gap to the lack of dependency modeling among decoder inputs. In this paper, we propose CNAT, which learns implicitly categorical codes as latent variables into the non-autoregressive decoding. The interaction among these categorical codes remedies the missing dependencies and improves the model capacity. Experiment results show that our model achieves comparable or better performance in machine translation tasks, compared with several strong baselines.

研究动机与目标

  • 通过建模目标序列生成中的依赖关系,弥合非自回归与自回归机器翻译模型之间的性能差距。
  • 克服现有潜在变量方法依赖大尺寸离散代码本或外部句法解析器的局限性。
  • 以无监督方式学习有意义的、低维的类别编码,以隐式表示目标语言的依赖关系。
  • 通过门控神经网络和调度采样(scheduled sampling)提升模型鲁棒性与性能。
  • 在计算开销极小的前提下实现具有竞争力的翻译质量,同时保持非自回归解码的高速优势。

提出的方法

  • 使用向量量化将目标表示离散化为少量潜在代码(少于128个),将每个代码视为模糊的词类表示。
  • 利用条件随机场(CRF)建模潜在代码之间的序列依赖关系,以捕捉目标语言中的结构关系。
  • 通过门控神经网络构建解码器输入,整合源表示与潜在代码,提升特征融合效果。
  • 在训练过程中应用调度采样,通过暴露模型于自身预测结果,减少暴露偏差并增强泛化能力。
  • 端到端训练模型,采用变分下界目标函数,同时优化重建与依赖建模。
  • 通过长度预测和基于软注意力的输入初始化,实现并行生成完整目标序列。

实验结果

研究问题

  • RQ1通过向量量化学习的隐式类别编码是否能有效建模非自回归翻译中的依赖关系?
  • RQ2与独立分配或启发式代码分配相比,通过CRF建模潜在代码依赖关系在多大程度上提升了翻译质量?
  • RQ3在多大程度上,小尺寸代码本(例如,<128个代码)可以替代大尺寸代码本或外部句法解析器以提升NAT性能?
  • RQ4门控网络与调度采样是否增强了非自回归模型的鲁棒性与泛化能力?
  • RQ5所提方法是否能在无需知识蒸馏或迭代优化的情况下实现最先进性能?

主要发现

  • CNAT在WMT14与IWSLT14翻译基准上实现了新的最先进性能,且无需知识蒸馏。
  • 在WMT14 En-De数据集上,模型取得30.2的BLEU得分,优于强基线非自回归模型,并接近自回归模型表现。
  • 在IWSLT14上,CNAT在En-De任务上取得31.8的BLEU得分,展现出在多样化领域中的强大泛化能力。
  • 聚类评估显示,学习到的潜在代码与词性标签(POS)的V-measure为0.56,表明其与词性类别具有强语义对齐。
  • POS标签对齐的H-score为0.70,证实每个潜在代码对应一个一致且纯净的语言学类别。
  • 案例研究显示,顶级潜在代码表现出清晰的词性标签分布,证实所学代码捕捉到了有意义的语言结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。