Skip to main content
QUICK REVIEW

[论文解读] Inducing and Embedding Senses with Scaled Gumbel Softmax

Fenfei Guo, Mohit Iyyer|arXiv (Cornell University)|Apr 22, 2018
Neural Networks and Applications参考文献 79被引用 3
一句话总结

该论文提出Gumbel Attention for Sense Induction(gasi),一种可微分的、基于注意力机制的模型,利用缩放的Gumbel-Softmax来诱导离散且可解释的词义。与先前方法不同,gasi在保持强大词相似度表现的同时,生成了更连贯、更符合人类理解的词义表征,这一结论通过一种新型以人为中心的连贯性评估得到验证。

ABSTRACT

Methods for learning word sense embeddings represent a single word with multiple sense-specific vectors. These methods should not only produce interpretable sense embeddings, but should also learn how to select which sense to use in a given context. We propose an unsupervised model that learns sense embeddings using a modified Gumbel softmax function, which allows for differentiable discrete sense selection. Our model produces sense embeddings that are competitive (and sometimes state of the art) on multiple similarity based downstream evaluations. However, performance on these downstream evaluations tasks does not correlate with interpretability of sense embeddings, as we discover through an interpretability comparison with competing multi-sense embeddings. While many previous approaches perform well on downstream evaluations, they do not produce interpretable embeddings and learn duplicated sense groups; our method achieves the best of both worlds.

研究动机与目标

  • 弥合计算机中心评估与人类可解释性之间在多义词嵌入中的差距。
  • 开发一种新评估指标,衡量词义表征在多大程度上支持人类对词义的理解。
  • 设计一种优先考虑人类用户可解释性与连贯性的模型,而不仅关注下游NLP性能。
  • 证明在人类参与的语义任务中,更简单、离散的词义诱导模型可超越复杂的上下文模型。
  • 通过将词义诱导与人类可用的词义词典对齐,弥合表征学习与词汇语义之间的脱节。

提出的方法

  • 采用类似Word2Vec的目标函数,联合学习每个词的上下文嵌入C和词义嵌入S。
  • 应用带有温度缩放的Gumbel-Softmax,从K个候选词义中可微分地采样离散词义。
  • 采用注意力机制基于局部上下文选择最相关的词义,实现硬性、可解释的词义分配。
  • 引入基于余弦距离阈值的剪枝策略,以去除重复或近似相同的词义。
  • 通过在所有可能词义上对上下文词进行边缘化,使用似然目标函数优化模型。
  • 使用软注意力基线模型(sasi)作为验证离散Gumbel-Softmax方法有效性的过渡步骤。

实验结果

研究问题

  • RQ1可微分的离散词义诱导模型能否生成比现有模型更具人类可解释性的词义表征?
  • RQ2计算机中心评估(如词相似度)与词义的人类中心可解释性之间存在何种相关性?
  • RQ3在人类参与的语义任务中,更简单、基于注意力机制的离散词义选择模型是否优于更复杂的端到端上下文模型?
  • RQ4通过温度缩放的Gumbel-Softmax在多大程度上能提升诱导词义的连贯性与区分度?
  • RQ5如何使词义诱导模型更好地与词义词典构建、语义漂移分析等语言学任务对齐?

主要发现

  • 所提出的连贯性评估成功揭示了现有多义词嵌入模型尽管在计算机中心性能上表现强劲,却往往无法生成符合人类理解的词义表征。
  • gasi在上下文与非上下文词相似度基准上均表现出具有竞争力的性能,且在可解释性方面优于先前模型。
  • 根据新型以人为中心的连贯性度量,gasi生成的词义表征比现有方法更具可区分性与连贯性。
  • 模型采用可微分的Gumbel-Softmax,实现了硬性离散词义选择,同时保持了完整的训练可微性,从而提升了可解释性。
  • 基于词义嵌入之间余弦距离的剪枝策略能有效去除冗余或重复的词义,提升词义清晰度。
  • 结果表明,未来的词义诱导应以人类驱动的任务特定指标为导向,而非仅依赖自动评估指标。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。