Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Lexical Substitution with Decontextualised Embeddings

Takashi Wada, Timothy Baldwin|arXiv (Cornell University)|Sep 17, 2022
Natural Language Processing Techniques被引用 4
一句话总结

本文提出了一种无监督的词汇替换方法,通过计算目标词的上下文嵌入与跨多个上下文平均的去上下文嵌入之间的余弦相似度来检索同义词。该方法在英语和意大利语上均优于强基线模型,尤其在低频词上表现更优,且无需微调或显式监督即可减少形态句法偏差。

ABSTRACT

We propose a new unsupervised method for lexical substitution using pre-trained language models. Compared to previous approaches that use the generative capability of language models to predict substitutes, our method retrieves substitutes based on the similarity of contextualised and decontextualised word embeddings, i.e. the average contextual representation of a word in multiple contexts. We conduct experiments in English and Italian, and show that our method substantially outperforms strong baselines and establishes a new state-of-the-art without any explicit supervision or fine-tuning. We further show that our method performs particularly well at predicting low-frequency substitutes, and also generates a diverse list of substitute candidates, reducing morphophonetic or morphosyntactic biases induced by article-noun agreement.

研究动机与目标

  • 为解决生成式语言模型在词汇替换中的局限性,如低频词表现差以及由上下文引起的形态句法偏差。
  • 开发一种完全无监督的方法,避免微调和显式监督,同时利用预训练模型。
  • 通过使用从多个上下文提取的平均去上下文词嵌入,改进同义词检索。
  • 减少英语和意大利语中由冠词-名词一致性和形态音系约束引起的偏差。
  • 在仅进行最小架构修改的前提下,实现在英语和意大利语词汇替换任务上的最先进性能。

提出的方法

  • 该方法使用预训练的Transformer模型(如BERT)计算目标词在上下文中的上下文表示,将选定层的表示求和以形成 f(x,c)。
  • 对于每个候选替换词 y,其去上下文嵌入 f(y) 通过从单语语料库中选取的 N 个句子中 y 的上下文表示的平均值得到。
  • 候选替换词根据 f(y) 与 f(x,c) 之间的余弦相似度进行排序,使用公式 S(y|x,c) = cos(f(y), f(x,c))。
  • 为处理多义性,该方法基于嵌入相似度将包含 y 的 N 个句子聚类为 K 组,然后为每组计算独立的去上下文嵌入 f^k(y)。
  • 该方法预先计算自定义词表 Ṽ 中所有词的 f(y),其中包含子词分词的低频词,从而支持 OOV 词的替换。
  • 该方法采用层聚合(层的求和)而非加权组合,因为后者未显示出显著性能提升。

实验结果

研究问题

  • RQ1基于嵌入相似度的完全无监督方法是否能在无需微调的情况下超越生成式方法在词汇替换中的表现?
  • RQ2与掩码语言模型生成相比,使用去上下文嵌入是否能提升在低频词或 OOV 词上的性能?
  • RQ3该方法在多大程度上减少了形态句法偏差,如英语和意大利语中由冠词-名词一致性引起的偏差?
  • RQ4性能在不同 Transformer 层之间如何变化?哪些层能为词汇替换提供最佳表示?
  • RQ5对词表示进行多义性聚类是否能提升多义词的同义词检索性能?

主要发现

  • 所提方法在无需任何微调或显式监督的情况下,在英语和意大利语的词汇替换基准上均达到新的最先进性能。
  • 在 SWORDS 数据集上,使用 30k 词表时,该方法达到 39.9 的 F1 值,优于 BERT-K(30.4)和 DeBERTa(39.9),展现出强大的泛化能力。
  • 当使用 30k 词表时,该方法预测的低频替换词数量(频率 < 50k)几乎是 BERT-K 基线的两倍。
  • 在 10k 词表下,该方法在 Fc 上仍优于 BERT-K(32.6 vs. 28.1),证实了其在词汇量有限时的有效性。
  • 该方法减少了形态句法偏差:避免了对前导冠词(如 'an increase' 导致以元音开头的词)的过度依赖,并生成了更多语义多样的替换词。
  • 使用多义性聚类可略微提升性能,Fc 从 K=1 时的 36.0 提升至 K=8 时的 36.9,但超过 K=8 后性能增益趋于平缓。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。