Skip to main content
QUICK REVIEW

[论文解读] Subword Regularization: Improving Neural Network Translation Models with Multiple Subword Candidates

Taku Kudo|arXiv (Cornell University)|Apr 29, 2018
Natural Language Processing Techniques被引用 6
一句话总结

本文提出子词正则化(subword regularization),一种简单而有效的方法,通过在训练过程中从一个单项语言模型中采样多个子词分段来提升神经机器翻译(NMT)模型的鲁棒性。该方法通过利用分段歧义作为数据增强的一种形式,显著提升了性能,尤其是在低资源和分布外设置下。

ABSTRACT

Subword units are an effective way to alleviate the open vocabulary problems in neural machine translation (NMT). While sentences are usually converted into unique subword sequences, subword segmentation is potentially ambiguous and multiple segmentations are possible even with the same vocabulary. The question addressed in this paper is whether it is possible to harness the segmentation ambiguity as a noise to improve the robustness of NMT. We present a simple regularization method, subword regularization, which trains the model with multiple subword segmentations probabilistically sampled during training. In addition, for better subword sampling, we propose a new subword segmentation algorithm based on a unigram language model. We experiment with multiple corpora and report consistent improvements especially on low resource and out-of-domain settings.

研究动机与目标

  • 通过子词单元减轻未知词的影响,解决神经机器翻译(NMT)中的开放词汇问题。
  • 利用子词分段中固有的歧义性——即单个词可被多种有效方式拆分——作为数据增强的一种形式,以提升模型泛化能力。
  • 基于单项语言模型开发一种新的子词分段算法,以生成具有概率分布的多样化子词候选,用于正则化。
  • 在不修改NMT架构的前提下,提升模型的鲁棒性和性能,尤其在低资源和分布外翻译设置下。

提出的方法

  • 提出在训练过程中动态采样子词,即对每个输入句子,从分段分布中概率性地采样多个子词序列。
  • 使用边缘化似然目标函数(公式3),通过对多个子词分段进行平均来训练NMT模型,通过蒙特卡洛采样(k个候选)进行近似。
  • 提出一种基于单项语言模型的新子词分段算法,为不同分段序列分配概率,并支持基于语言模型概率的偏向性采样,以生成更合理的分段。
  • 独立地对源句和目标句应用该方法,允许在编码器或解码器侧灵活地进行正则化。
  • 使用超参数 l(采样候选数量)和 α(平滑常数)来控制采样分段的多样性与质量。
  • 将该方法实现为一种轻量级、与架构无关的正则化技术,无需对底层NMT模型进行任何修改。

实验结果

研究问题

  • RQ1在NMT训练中利用多个子词分段是否能提升模型的鲁棒性和翻译质量?
  • RQ2基于语言模型的子词分段算法是否相比标准BPE能带来更高的采样多样性与性能?
  • RQ3子词正则化在低资源和分布外翻译设置下的性能影响如何?
  • RQ4当正则化同时应用于源句和目标句时,其效果是否更强?还是仅在某一侧更有效?
  • RQ5采样超参数(l 和 α)的最优配置是什么,才能实现一致的性能提升?

主要发现

  • 在 IWSLT15(en→vi)数据集上,子词正则化相比基线模型实现了 2.18 BLEU 点的提升,当源句和目标句均被正则化时,最终得分达到 27.68。
  • 在 IWSLT17(en→vi)数据集上,该方法将 BLEU 从基线的 25.49 提升至 27.68(完全正则化),表明在不同领域下均具有稳定的性能增益。
  • 在 WMT14(en→de)数据集上,基于单项语言模型的子词正则化方法取得了 25.04 的最高 BLEU 得分,优于 BPE(24.53)及其他子词方法。
  • 单侧正则化(仅对源句或目标句)仍能带来可观的性能提升——例如在 en→vi 任务上达到 26.10 BLEU,表明该方法对编码器和解码器组件均有益处。
  • 平滑超参数 α 至关重要:当 α=0.0 时,性能显著下降,尤其是在 l 较大时,表明基于语言模型概率的偏向性采样是必不可少的。
  • 该方法在低资源设置下最为有效,例如 IWSLT15,其性能增益最为显著,表明在数据稀缺场景下具有强大的正则化效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。