[论文解读] Non-Parametric Online Learning from Human Feedback for Neural Machine Translation
本文提出KNN-over-KNN(KoK),一种用于神经机器翻译(NMT)的非参数化在线学习方法,采用两个k近邻(KNN)模块:一个用于存储人工校对的翻译结果,另一个用于在NMT模型与基于反馈的KNN模块之间动态平衡。该方法在不修改NMT架构或需要在线模型更新的前提下,显著提升了翻译质量——BLEU最高提升12.9分,TER最高降低9.7分,同时减少了重复人工校对的需求。
We study the problem of online learning with human feedback in the human-in-the-loop machine translation, in which the human translators revise the machine-generated translations and then the corrected translations are used to improve the neural machine translation (NMT) system. However, previous methods require online model updating or additional translation memory networks to achieve high-quality performance, making them inflexible and inefficient in practice. In this paper, we propose a novel non-parametric online learning method without changing the model structure. This approach introduces two k-nearest-neighbor (knn) modules: one module memorizes the human feedback, which is the correct sentences provided by human translators, while the other balances the usage of the history human feedback and original NMT models adaptively. Experiments conducted on EMEA and JRC-Acquis benchmarks demonstrate that our proposed method obtains substantial improvements on translation accuracy and achieves better adaptation performance with less repeating human correction operations.
研究动机与目标
- 解决在无需昂贵在线模型更新的情况下,实时适应神经机器翻译(NMT)系统中人类反馈的挑战。
- 通过减少对同一句子重复校对的需求,降低人工后处理的工作量。
- 在避免灾难性遗忘和计算开销增加的前提下,维持高翻译质量,实现实时适应。
- 开发一种即插即用的方法,适用于预训练的NMT模型,且无需修改网络架构。
提出的方法
- 提出双KNN机制:Token-KNN利用语义相似度,从数据存储中存储并检索人工校对的翻译结果。
- 采用Policy-KNN,通过在检索特征上使用k-最近邻分类器,学习NMT模型与Token-KNN之间插值权重(λ)的动态分配。
- 基于检索相关性与校对质量,将二元标志(1表示有效,0表示噪声)作为Policy-KNN数据存储中的标签。
- 利用从Token-KNN检索结果中提取的特征构建Policy-KNN数据存储,实现对模型与反馈之间平衡的上下文感知调节。
- 应用插值机制:最终翻译概率 = λ × p(Token-KNN) + (1−λ) × p(NMT),其中λ由Policy-KNN预测得出。
- 在实验中使用最优参考文本模拟人类反馈,确保对适应性能的可控评估。
实验结果
研究问题
- RQ1非参数化方法能否在不更新模型参数的情况下,有效适应NMT对人类反馈?
- RQ2在推理过程中,如何动态优化预训练NMT模型与人工校对翻译之间的平衡?
- RQ3KoK在多大程度上可减少有效适应所需的重复人工校对次数?
- RQ4在低资源反馈设置下,所提方法是否优于现有的在线学习与记忆增强型NMT方法?
主要发现
- 在EMEA和JRC-Acquis基准测试中,KoK相较于预训练NMT模型,最高实现12.9 BLEU提升与9.7 TER降低。
- 该方法在所有文档长度区间(包括短句与长句)中,均持续优于当前最先进的在线学习基线模型。
- Policy-KNN通过减少无关检索结果的干扰,实现了更快的适应速度,表现为所有长度下R指标(R1–R5)的快速提升。
- KoK减少了重复人工校对的需求,表现为适应性能更快收敛且对重复编辑的依赖性更低。
- 该方法以极低的计算成本实现了具有竞争力的性能,避免了在线梯度更新与灾难性遗忘。
- 当Token-KNN的检索概率较高时,Policy-KNN学习到的平均插值权重λ也更高,表明其能根据检索质量实现有效的动态加权。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。