Skip to main content
QUICK REVIEW

[论文解读] Vector Embedding of Wikipedia Concepts and Entities

Ehsan Sherkat, Evangelos Milios|arXiv (Cornell University)|Feb 12, 2017
Topic Modeling参考文献 14被引用 9
一句话总结

本文提出 ConVec 方法,利用深度学习技术,基于维基百科的链接结构和内容,学习低维的维基百科概念与实体向量表示。该方法生成明确且上下文感知的嵌入向量,在概念类比与相似性任务上达到或超越当前最先进水平,表明在高质量概念嵌入中,语料质量比规模更为重要。

ABSTRACT

Using deep learning for different machine learning tasks such as image classification and word embedding has recently gained many attentions. Its appealing performance reported across specific Natural Language Processing (NLP) tasks in comparison with other approaches is the reason for its popularity. Word embedding is the task of mapping words or phrases to a low dimensional numerical vector. In this paper, we use deep learning to embed Wikipedia Concepts and Entities. The English version of Wikipedia contains more than five million pages, which suggest its capability to cover many English Entities, Phrases, and Concepts. Each Wikipedia page is considered as a concept. Some concepts correspond to entities, such as a person's name, an organization or a place. Contrary to word embedding, Wikipedia Concepts Embedding is not ambiguous, so there are different vectors for concepts with similar surface form but different mentions. We proposed several approaches and evaluated their performance based on Concept Analogy and Concept Similarity tasks. The results show that proposed approaches have the performance comparable and in some cases even higher than the state-of-the-art methods.

研究动机与目标

  • 开发一种学习维基百科概念与实体密集向量表示的方法,使其具有明确性,不同于传统词嵌入。
  • 评估较小但高质量的语料是否优于更大但噪声较多的语料,以生成更优的概念嵌入。
  • 比较不同嵌入策略(尤其是利用维基百科锚点链接与启发式消歧方法)在标准基准任务上的性能。
  • 研究预训练词向量对微调概念嵌入模型质量的影响。
  • 公开发布大规模、高覆盖率的维基百科概念与词向量集合,供研究使用。

提出的方法

  • 该方法基于带有负采样的跳字模型(与 Word2Vec 类似)的深度学习框架,从文本上下文中学习维基百科概念的向量表示。
  • 每篇维基百科页面被视为一个独立概念,其嵌入向量从周围词语和锚点链接(指向其他维基百科页面的超链接)中学习。
  • 采用启发式消歧策略,将模糊词语映射到其最常出现的维基百科概念,从而在不损失准确性的前提下提升覆盖率。
  • 模型在 21 亿词的维基百科数据集上进行训练,嵌入向量初始化使用来自更大语料的预训练词向量,以提升性能。
  • 该方法支持单词与概念的统一向量空间,实现联合语义分析。
  • 该模型的一个变体仅使用锚点链接(不使用周围文本),以评估链接结构本身对贡献的影响。

实验结果

研究问题

  • RQ1使用较小但高质量的维基百科语料是否能产生优于更大但噪声较多语料的概念嵌入?
  • RQ2能否通过实现明确的概念嵌入(即同一词语的不同含义由不同向量表示)来提升类比与相似性等 NLP 任务的性能?
  • RQ3使用预训练词向量进行微调如何影响维基百科概念嵌入的质量?
  • RQ4与文本上下文相比,维基百科链接结构(锚点)在有效概念表示中的贡献程度如何?
  • RQ5启发式消歧是否能在不降低性能的前提下提升概念嵌入的覆盖率?

主要发现

  • ConVec 模型在概念类比任务上达到最先进或具有竞争力的性能,在 WS-SIM 数据集上的斯皮尔曼等级相关系数为 0.7596。
  • 在短语相似性任务中,采用启发式消歧的 ConVec 模型在所有数据集上的平均斯皮尔曼等级相关系数达到 0.5054,优于多个基线模型。
  • 在 21 亿词的维基百科数据集(小于谷歌 1000 亿词的 Freebase 数据集)上训练的模型优于更大规模语料,表明语料质量比规模更为重要。
  • 启发式消歧方法在几乎不损失性能的前提下显著提升了覆盖率,表明可在不牺牲准确性的情况下实现嵌入的可扩展性。
  • 仅使用锚点链接的 ConVec 变体在平均性能上劣于完整上下文模型,表明文本上下文比仅链接结构更具信息量。
  • 该模型性能与 Wikipedia Miner 和 HitSim 等结构化方法相当,证实其有效捕捉了维基百科基于链接的语义结构。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。