Skip to main content
QUICK REVIEW

[论文解读] Discovering Latent Concepts and Exploiting Ontological Features for Semantic Text Search

Vuong M. Ngo, Tru H. Cao|arXiv (Cornell University)|Jul 15, 2018
Topic Modeling参考文献 56被引用 12
一句话总结

该论文提出了一种基于本体的广义向量空间模型,通过关系约束的传播激活发现潜在语义概念,利用本体特征(如同义词、上下位词和词义)提升语义文本搜索性能。在基准数据集上,使用MAP作为评估指标,该方法相比基于关键词的模型提升了41.9%,相比传统的受限传播激活模型提升了29.3%。

ABSTRACT

Named entities and WordNet words are important in defining the content of a text in which they occur. Named entities have ontological features, namely, their aliases, classes, and identifiers. WordNet words also have ontological features, namely, their synonyms, hypernyms, hyponyms, and senses. Those features of concepts may be hidden from their textual appearance. Besides, there are related concepts that do not appear in a query, but can bring out the meaning of the query if they are added. The traditional constrained spreading activation algorithms use all relations of a node in the network that will add unsuitable information into the query. Meanwhile, we only use relations represented in the query. We propose an ontology-based generalized Vector Space Model to semantic text search. It discovers relevant latent concepts in a query by relation constrained spreading activation. Besides, to represent a word having more than one possible direct sense, it combines the most specific common hypernym of the remaining undisambiguated multi-senses with the form of the word. Experiments on a benchmark dataset in terms of the MAP measure for the retrieval performance show that our model is 41.9% and 29.3% better than the purely keyword-based model and the traditional constrained spreading activation model, respectively.

研究动机与目标

  • 为解决基于关键词的文本检索的局限性,捕捉查询中未显式出现的潜在语义概念。
  • 通过利用WordNet和命名实体元数据中的同义词、上下位词和词义等本体特征,提升语义文本搜索性能。
  • 通过仅限制在查询中显式存在的关系上进行传播激活,避免引入噪声或无关信息。
  • 通过将最具体的共同上位词与词形相结合,提升词表示,以解决多义词歧义问题。
  • 开发一种整合本体知识的广义向量空间模型,以提升检索性能。

提出的方法

  • 采用关系约束的传播激活机制,仅通过查询中显式存在的关系传播相关性,避免引入虚假关联。
  • 通过查询词及其本体关系(如上下位词和同义词)激活知识图谱中的节点,发现潜在概念。
  • 对于多义词,通过所有可能词义的最具体的共同上位词与词的表面形式计算组合表示。
  • 通过在词项权重方案中引入本体特征,扩展传统向量空间模型,增强语义表示。
  • 利用WordNet和命名实体本体,通过别名、类别和词义区分等语义元数据丰富查询和文档的表示。
  • 在扩展的向量空间中,通过增强查询与文档向量之间的加权余弦相似度计算最终的文档排序。

实验结果

研究问题

  • RQ1如何在不引入无关信息的前提下,有效发现查询中潜在的语义概念?
  • RQ2同义词、上下位词和词义等本体特征能在多大程度上提升语义文本搜索性能?
  • RQ3关系约束的传播激活机制是否能优于使用所有关系的传统传播激活方法?
  • RQ4如何表示多义词,以在减少歧义的同时保持语义特异性?
  • RQ5将本体特征整合到广义向量空间模型中,是否能带来可测量的检索有效性提升?

主要发现

  • 所提出的模型在纯基于关键词的检索模型基础上,实现了41.9%的平均平均精度(MAP)提升。
  • 在MAP指标上,相比传统的受限传播激活模型,性能提升了29.3%,证明了关系约束传播机制的有效性。
  • 整合上下位词和同义词等本体特征显著增强了模型检索语义相关文档的能力。
  • 将最具体的共同上位词与词形结合的方法,有效解决了多义词歧义问题,提升了表示质量。
  • 关系约束的传播激活机制成功识别出相关潜在概念,同时最小化了来自无关关系的噪声。
  • 结果证实,在广义向量空间模型中利用结构化本体知识,可显著提升语义文本搜索性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。