[论文解读] Nearest Neighbor Machine Translation
本文提出k-最近邻神经机器翻译(kNN-MT),一种非参数化方法,通过使用语义表示从大规模静态数据存储中检索相关翻译示例,来增强预训练的神经机器翻译模型。通过将模型输出与数十亿个缓存示例上的最近邻分类器进行插值,kNN-MT在无需微调的情况下,使分布外数据的翻译质量提升最高达9.2 BLEU,多语言适应场景下提升3 BLEU。
We introduce $k$-nearest-neighbor machine translation ($k$NN-MT), which predicts tokens with a nearest neighbor classifier over a large datastore of cached examples, using representations from a neural translation model for similarity search. This approach requires no additional training and scales to give the decoder direct access to billions of examples at test time, resulting in a highly expressive model that consistently improves performance across many settings. Simply adding nearest neighbor search improves a state-of-the-art German-English translation model by 1.5 BLEU. $k$NN-MT allows a single model to be adapted to diverse domains by using a domain-specific datastore, improving results by an average of 9.2 BLEU over zero-shot transfer, and achieving new state-of-the-art results -- without training on these domains. A massively multilingual model can also be specialized for particular language pairs, with improvements of 3 BLEU for translating from English into German and Chinese. Qualitatively, $k$NN-MT is easily interpretable; it combines source and target context to retrieve highly relevant examples.
研究动机与目标
- 通过利用外部缓存示例,在无需微调的情况下提升神经机器翻译性能。
- 使用单个预训练模型和领域特定数据存储,实现领域自适应与多语言专业化。
- 通过可见且相关的训练示例使检索决策透明,从而提升模型可解释性。
- 将最近邻检索扩展至数十亿对键值对,以在生成任务中实现高表达能力。
提出的方法
- 该方法使用预训练的神经MT模型计算源序列和部分目标序列的上下文表示。
- 在离线阶段构建数据存储,其中键为解码器表示 f(s, t_{1:i-1}),值为真实的目标词元 t_i。
- 在推理阶段,模型使用当前上下文表示查询数据存储,基于余弦相似度检索k个最近邻。
- 通过温度缩放的softmax计算从k个检索到的邻居中得到的目标词元分布。
- 最终预测为神经模型输出与kNN分布之间的加权插值。
- 该方法无需额外训练,可应用于任意预训练的MT模型。
实验结果
研究问题
- RQ1在无需微调的情况下,对大规模静态数据存储进行最近邻检索是否能提升神经机器翻译性能?
- RQ2kNN-MT是否能通过使用领域特定数据存储,有效将单一模型适应到分布外或低资源领域?
- RQ3基于上下文表示的逐标记检索是否比句子级检索产生更相关的示例?
- RQ4kNN-MT是否能在不重新训练的情况下提升多语言模型在特定语对上的表现?
主要发现
- kNN-MT在无需任何训练的情况下,使最先进的德语-英语翻译模型性能提升1.5 BLEU。
- 当使用领域特定数据存储将模型适应到分布外领域时,kNN-MT在零样本迁移基础上平均提升9.2 BLEU。
- 对于多语言模型,kNN-MT通过使用语言对特定数据存储,使英语到德语和中文的翻译性能分别提升3 BLEU。
- 检索结果具有高度上下文相关性,示例显示了对子词表示的有效利用,例如重建被拆分到多个子词中的命名实体。
- 该方法具有可解释性,因为检索到的示例可直接查看,并对预测产生实质性贡献。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。