[论文解读] Improving Word Sense Disambiguation in Neural Machine Translation with Salient Document Context
本文提出一种简单且可扩展的方法,通过在源句前添加从伪文档中提取的关键字来改进神经机器翻译中的词义消歧(WSD),而无需修改模型架构。该方法在新的测试集 doc-MuCoW 上优于句级和文档级基线模型,同时通过使用噪声较大的伪文档而非真实的文档级数据,显著降低了训练成本。
Lexical ambiguity is a challenging and pervasive problem in machine translation (\mt). We introduce a simple and scalable approach to resolve translation ambiguity by incorporating a small amount of extra-sentential context in neural \mt. Our approach requires no sense annotation and no change to standard model architectures. Since actual document context is not available for the vast majority of \mt training data, we collect related sentences for each input to construct pseudo-documents. Salient words from pseudo-documents are then encoded as a prefix to each source sentence to condition the generation of the translation. To evaluate, we release \docmucow, a challenge set for translation disambiguation based on the English-German \mucow \cite{raganato-etal-2020-evaluation} augmented with document IDs. Extensive experiments show that our method translates ambiguous source words better than strong sentence-level baselines and comparable document-level baselines while reducing training costs.
研究动机与目标
- 为解决神经机器翻译中词义消歧(WSD)的长期挑战,即句级模型因缺乏句外上下文而失效。
- 开发一种无需架构修改或词义标注即可将文档级上下文引入句级机器翻译系统的方法。
- 在新的、具有挑战性的测试集——doc-MuCoW 上评估该方法,该测试集通过添加文档ID以衡量WSD性能。
- 证明基于显著性的上下文提取方法,从伪文档中提取关键信息,可在远低于全文档级模型的训练成本下实现相当的性能。
提出的方法
- 通过基于URL、主题或聚类的相似性,从平行单语数据(如ParaCrawl)中聚合相关句子,构建‘伪文档’,形成虽有噪声但信息丰富的上下文。
- 应用显著性函数——无论是TF-IDF还是基于BERT的嵌入相似度——从每个伪文档中提取最相关的前k个关键词。
- 将每个源句前缀添加前k个显著词,形成修改后的输入序列:$ x' = \hat{\mathbf{w}}^k \oplus [\langle\textsc{SEP}\rangle] \oplus x $,使翻译模型能够基于全局上下文进行条件化。
- 保持标准神经机器翻译模型架构、损失函数和解码过程不变,确保与现有系统和训练流程的兼容性。
- 在训练和推理过程中均使用相同的前缀技术,实现端到端学习,仅需最小程度的修改。
- 在新的测试集 doc-MuCoW 上评估性能,该数据集源自MuCoW,通过添加文档ID以支持文档级WSD评估。

实验结果
研究问题
- RQ1从伪文档中提取的显著关键词是否能改善句级神经机器翻译中的词义消歧?
- RQ2该方法是否在WSD性能上优于强句级基线和可比的文档级模型,同时降低训练成本?
- RQ3性能增益在不同句长和词汇歧义程度下如何变化?
- RQ4显著性函数的选择(TF-IDF 与 BERT)在多大程度上影响WSD性能?
主要发现
- 所提方法在doc-MuCoW测试集上优于句级和文档级基线模型,证明了显著上下文的有效性。
- 与强句级基线相比,该模型在WSD聚焦评估中提升了+1.8 BLEU,表明在消歧准确率上取得了显著提升。
- 性能增益在短句中最为显著,表明当句内上下文稀疏时,有限的上下文信息最为有益。
- 与完整文档级模型相比,该方法显著降低了训练成本,后者需要复杂的架构和大规模文档排序数据。
- TF-IDF和基于BERT的显著性函数均取得优异结果,其中基于BERT的显著性函数在歧义词上表现略优。
- 该框架泛化能力良好:即使使用噪声大、自动生成的伪文档,性能仍保持稳定,表明对数据质量问题具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。