Skip to main content
QUICK REVIEW

[论文解读] Better Datastore, Better Translation: Generating Datastores from Pre-Trained Models for Nearest Neural Machine Translation

Jiahuan Li, Shanbo Cheng|arXiv (Cornell University)|Dec 17, 2022
Natural Language Processing Techniques被引用 4
一句话总结

本文提出 PRED,一种利用预训练模型(PTMs)生成更高品质数据存储的框架,用于 k-NN 神经机器翻译(k-NNMT),从而提升检索准确率与翻译性能。通过利用 PTMs 构建数据存储,并引入对比对齐目标以弥合表征差异,PRED 在不增加 NMT 模型参数量的前提下,实现了更优的翻译结果,在双语与多语言基准测试中均优于基线模型。

ABSTRACT

Nearest Neighbor Machine Translation (kNNMT) is a simple and effective method of augmenting neural machine translation (NMT) with a token-level nearest neighbor retrieval mechanism. The effectiveness of kNNMT directly depends on the quality of retrieved neighbors. However, original kNNMT builds datastores based on representations from NMT models, which would result in poor retrieval accuracy when NMT models are not good enough, leading to sub-optimal translation performance. In this paper, we propose PRED, a framework that leverages Pre-trained models for Datastores in kNN-MT. Better representations from pre-trained models allow us to build datastores of better quality. We also design a novel contrastive alignment objective to mitigate the representation gap between the NMT model and pre-trained models, enabling the NMT model to retrieve from better datastores. We conduct extensive experiments on both bilingual and multilingual translation benchmarks, including WMT17 English $\leftrightarrow$ Chinese, WMT14 English $\leftrightarrow$ German, IWSLT14 German $\leftrightarrow$ English, and IWSLT14 multilingual datasets. Empirical results demonstrate the effectiveness of PRED.

研究动机与目标

  • 解决因使用表现欠佳的 NMT 模型表征构建低质量数据存储而导致的 k-NNMT 翻译性能不佳的问题。
  • 通过利用预训练模型(PTMs)的优越表征,提升数据存储中键-值(K-V)的一致性。
  • 通过一种新颖的对比对齐目标,缓解 NMT 模型与 PTM 生成的数据存储之间的表征差异。
  • 通过避免增加 NMT 模型大小,保持推理效率,同时提升检索与翻译质量。
  • 在多样化的双语与多语言翻译基准测试中,证明基于 PTM 的数据存储生成方法的有效性。

提出的方法

  • 使用强大预训练模型(PTMs)的表征而非 NMT 模型的表征来构建数据存储,从而实现更高的 K-V 一致性。
  • 在推理过程中,使用 NMT 模型的解码状态作为查询,同时从基于 PTM 表征构建的数据存储中检索。
  • 设计一种对比对齐目标,将 NMT 模型的查询表征与 PTM 生成数据存储中的对应键进行对齐。
  • 端到端训练 NMT 模型,引入对比对齐目标,以在表征分布偏移的情况下提升检索的相关性。
  • 在推理阶段,采用温度缩放加权融合 NMT 与 k-NN 概率的方法,使用来自 PTM 构建的数据存储中检索到的值。
  • 通过保持原始 NMT 架构不变,仅修改数据存储与检索过程,确保 NMT 模型大小不增加。

实验结果

研究问题

  • RQ1利用预训练模型生成数据存储,是否能显著提升 k-NNMT 中的检索准确率与翻译质量?
  • RQ2NMT 模型与预训练模型之间的表征差异如何影响检索性能?该差异能否被有效缓解?
  • RQ3与 NMT 生成的数据存储相比,使用 PTM 生成的数据存储是否能带来更高的 K-V 一致性?
  • RQ4当查询与键的表征来自不同模型时,对比对齐目标是否能提升检索性能?
  • RQ5PRED 是否在保持计算效率的同时,优于现有 k-NNMT 方法,在多语言与双语基准测试中表现更优?

主要发现

  • 在 WMT17 英文↔中文、WMT14 英文↔德文、IWSLT14 德文↔英文以及 IWSLT14 多语言翻译基准测试中,PRED 在 k-NNMT 及其他基线方法上均实现了稳定提升。
  • 在 WMT17 中文↔英文基准上,PRED 达到 32.1 的 BLEU 分数,比最强基线高出 1.2 BLEU 点。
  • 在 WMT14 英文↔德文基准上,PRED 相较于 k-NNMT 提升了 1.0 的 BLEU 分数,显示出在低资源与复杂翻译场景下的显著优势。
  • 对比对齐目标显著提升了检索准确率,尤其在语义相近但不可互换的词汇(如人称代词与系动词)上表现突出,如定性分析与图 6 所示。
  • PRED 保持与 k-NNMT 相同的 NMT 模型大小,未增加推理成本,同时实现了更优的翻译质量。
  • 消融实验表明,PTM 生成数据存储与对比对齐目标对性能提升均至关重要,任一组件的移除均导致 BLEU 分数显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。