[论文解读] Contextual Text Denoising with Masked Language Models
本文提出一种基于预训练掩码语言模型(如 BERT)的上下文文本去噪方法,无需微调或成对训练数据即可纠正噪声文本。通过掩码词语并利用上下文预测,该方法在翻译、自然语言推理(NLI)和释义检测任务中显著提升了下游 NLP 任务的性能,相比拼写检查器等基线模型,BLEU 和 F1 分数均有显著提升。
Recently, with the help of deep learning models, significant advances have been made in different Natural Language Processing (NLP) tasks. Unfortunately, state-of-the-art models are vulnerable to noisy texts. We propose a new contextual text denoising algorithm based on the ready-to-use masked language model. The proposed algorithm does not require retraining of the model and can be integrated into any NLP system without additional training on paired cleaning training data. We evaluate our method under synthetic noise and natural noise and show that the proposed algorithm can use context information to correct noise text and improve the performance of noisy inputs in several downstream tasks.
研究动机与目标
- 解决当前 SOTA NLP 模型对噪声输入(如拼写错误和打字错误)的脆弱性。
- 开发一种利用预训练掩码语言模型上下文信息的去噪方法,无需微调或成对清洗数据。
- 提升 NLP 系统在机器翻译、自然语言推理和释义检测等下游任务中对合成噪声和真实噪声的鲁棒性。
- 评估该去噪方法在干净文本上的表现,避免对本已正确的输入造成性能下降。
提出的方法
- 该方法按顺序处理句子中的每个词,将其用 [MASK] 标记掩码,同时保留周围词语的上下文信息。
- 对于每个被掩码的词,模型使用预训练的掩码语言模型(如 BERT)生成潜在更正词的候选列表,该模型基于左右上下文预测被掩码的词。
- 每个词的掩码次数可变(经验设定为 N=4),以生成多个掩码后的句子变体,提高捕捉正确词语的可能性。
- 通过将原始噪声句子与每个掩码变体拼接,应用文本增强技术,以提升候选质量与上下文感知能力。
- 最终更正结果从候选列表中通过基于编辑距离的规则选择,优先选择与原始输入拼写相近的候选词。
- 该方法按从左到右的顺序执行,跳过标点符号和数字,且无需对任何 NLP 系统进行微调,具有广泛兼容性。
实验结果
研究问题
- RQ1仅依赖上下文信息,预训练掩码语言模型能否在无需微调或标注数据的情况下有效恢复噪声文本?
- RQ2与基于规则的拼写检查器相比,所提出的去噪方法在噪声输入上的下游 NLP 任务性能提升如何?
- RQ3在干净文本上应用该去噪算法是否会降低性能,从而体现其对过度纠正的鲁棒性?
- RQ4该方法在多样化 NLP 任务中,对合成噪声和真实噪声的性能提升程度如何?
主要发现
- 在 IWSLT 2014 英语到德语翻译任务中,该方法将 fairseq Transformer 模型的 BLEU 分数从 22.27(人工噪声)和 17.29(自然噪声)分别提升至 25.80 和 21.40。
- 在 Google Translate 上,该方法将 BLEU 分数从 28.11(人工噪声)和 25.22(自然噪声)分别提升至 28.96 和 25.49。
- 在 SNLI 自然语言推理任务中,该方法将准确率从 75.0(人工噪声)和 74.0(自然噪声)分别提升至 81.0 和 77.0,同时在干净文本上保持接近原始水平的性能(83.0)。
- 在 MRPC 释义检测任务中,该方法将 F1 分数从 81.9(人工噪声)和 75.2(自然噪声)分别提升至 82.7 和 76.4,优于原始模型和拼写检查器基线。
- 该方法在干净输入上表现出极小的性能下降,SNLI 准确率仅从 84.0 降至 83.0(下降 1.0 分),表明其对过度纠正具有鲁棒性。
- 结合文本增强与基于编辑距离的候选过滤,显著提升了更正准确率,而基线拼写检查器在噪声输入上常导致性能下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。