Skip to main content
QUICK REVIEW

[论文解读] Learning Decoupled Retrieval Representation for Nearest Neighbour Neural Machine Translation

Qiang Wang, Rongxiang Weng|arXiv (Cornell University)|Sep 19, 2022
Natural Language Processing Techniques被引用 4
一句话总结

本文提出 Clknn,一种通过监督对比学习将检索表征与标准 NMT 上下文表征解耦的方法,以提升 k-最近邻神经机器翻译性能。通过使用轻量级适配器和难样本挖掘学习专用检索向量,Clknn 在五个领域中均实现了更高的检索准确率与 BLEU 分数,同时相比原始 kNN-MT 的推理速度损失极小。

ABSTRACT

K-Nearest Neighbor Neural Machine Translation (kNN-MT) successfully incorporates external corpus by retrieving word-level representations at test time. Generally, kNN-MT borrows the off-the-shelf context representation in the translation task, e.g., the output of the last decoder layer, as the query vector of the retrieval task. In this work, we highlight that coupling the representations of these two tasks is sub-optimal for fine-grained retrieval. To alleviate it, we leverage supervised contrastive learning to learn the distinctive retrieval representation derived from the original context representation. We also propose a fast and effective approach to constructing hard negative samples. Experimental results on five domains show that our approach improves the retrieval accuracy and BLEU score compared to vanilla kNN-MT.

研究动机与目标

  • 解决在使用共享上下文表征同时处理翻译与检索任务时,kNN-MT 性能欠佳的问题。
  • 学习一种专用且更具判别力的检索表征,以更好地区分相似目标词。
  • 在低资源和分布外设置下,提升检索准确率与下游翻译性能(BLEU)。
  • 开发一种高效的方法以构建难负样本,增强对比学习效果。
  • 确保所提方法在推理速度上与原始 kNN-MT 相当。

提出的方法

  • 使用轻量级前馈网络适配器将标准 NMT 上下文表征 h 转换为专用检索表征 z。
  • 应用监督对比学习,使用多个正样本与负样本训练适配器,以优化检索性能。
  • 通过聚类检索向量并从最近的 K=128 个聚类中采样,构建难负样本,以增强学习信号。
  • 在推理阶段,使用检索表征 z 从数据存储中查找 k 个最近邻,取代原始 h 作为查询向量。
  • 最终翻译概率通过可学习插值系数 λ,将标准 NMT 输出与基于检索的概率相结合。
  • 应用 PCA 投影将维度降至 128,以利用 FAISS 实现高效向量检索。

实验结果

研究问题

  • RQ1将检索表征与标准 NMT 上下文表征解耦,是否能提升 kNN-MT 中的检索准确率与翻译性能?
  • RQ2在对比学习中使用多个正样本与负样本,是否能获得优于单样本方法的检索表征?
  • RQ3一种快速且有效的难负样本采样策略,是否能在不显著增加计算成本的前提下提升对比学习效果?
  • RQ4尽管增加了适配器,所提方法是否仍能保持与原始 kNN-MT 相当的推理速度?
  • RQ5该方法在分布内与分布外测试集上的表现是否具有强鲁棒性?

主要发现

  • 与原始 kNN-MT 相比,Clknn 在五个领域上的 BLEU 分数平均提升超过 1 个点,其中在医学领域最高提升达 1.64 BLEU 点。
  • Clknn 在所有 top-k 值下均持续优于 kNN-MT,证明其邻居检索更具鲁棒性与准确性。
  • 使用 M=2 个正样本与 N=32 个负样本时性能最佳,且增加负样本数量(N)比增加正样本数量(M)能提供更强的学习信号。
  • 该方法推理速度与 kNN-MT 相当(为基线的 97% ± 2%),证实适配器引入的开销极小。
  • 分布内与分布外设置间的性能差距缩小至仅 0.3 BLEU 点,表明模型具备强泛化能力,且对分布内数据的依赖性显著降低。
  • t-SNE 可视化结果表明,与基线相比,Clknn 学习到的表征更加紧凑且可分,尤其在低频词上表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。