Skip to main content
QUICK REVIEW

[论文解读] Extracting Keyword for Disambiguating Name Based on the Overlap Principle

Mahyuddin K. M. Nasution|arXiv (Cornell University)|Jan 30, 2016
Advanced Text Analysis Techniques参考文献 9被引用 5
一句话总结

本文提出了一种基于重叠原则的关键词提取方法,用于姓名消歧,利用网页片段和基于术语特征集合交集的相似度度量。在真实世界数据集上,该方法实现了0.36的F-measure,表明基于重叠的关键词选择能提升模糊姓名情境下的消歧准确率。

ABSTRACT

Name disambiguation has become one of the main themes in the Semantic Web agenda. The semantic web is an extension of the current Web in which information is not only given well-defined meaning, but also has many purposes that contain the ambiguous naturally or a lot of thing came with the overlap, mainly deals with the persons name. Therefore, we develop an approach to extract keywords from web snippet with utilizing the overlap principle, a concept to understand things with ambiguous, whereby features of person are generated for dealing with the variety of web, the web is steadily gaining ground in the semantic research.

研究动机与目标

  • 为解决语义网和信息检索背景下模糊人名消歧的挑战。
  • 从网页片段中提取能反映人物真实身份的有意义关键词,即使存在多义性和同义性。
  • 应用重叠原则,通过术语集合交集识别模糊姓名与候选指代对象之间的共享特征。
  • 通过利用从搜索结果中动态提取的上下文敏感关键词,提升姓名消歧性能。
  • 在真实世界的人名引用数据集上,使用召回率、精确率和F-measure对方法进行评估。

提出的方法

  • 该方法将模糊姓名建模为网页片段集合中的术语,利用重叠原则识别候选姓名与其指代对象之间的共享特征。
  • 定义了重叠原则的两个条件:术语集合交集非空,且与正确指代对象的重叠程度高于与错误指代对象的重叠程度。
  • 应用基于Kolmogorov复杂度的相似度度量:$sim(t_x,t_y) = \frac{\log(2|\Omega_x \cap \Omega_y|)}{\log(|\Omega_x| + |\Omega_y|)}$。
  • 通过搜索查询从网页片段中提取关键词,并根据与已知指代对象特征的重叠程度对候选术语进行排序。
  • 利用相似度评分对同一人物的引用进行聚类,并对聚类结果进行人工验证。
  • 评估使用标准指标:召回率、精确率和F-measure,按聚类计算并取所有引用的平均值。

实验结果

研究问题

  • RQ1如何将重叠原则应用于从网页片段中提取模糊姓名的消歧关键词?
  • RQ2基于术语集合重叠的关键词提取在多大程度上能提升姓名消歧性能?
  • RQ3基于集合交集的相似度度量能否有效区分正确与错误的姓名引用?
  • RQ4在消歧过程中,不同关键词的召回率与精确率如何变化?
  • RQ5所提出方法在真实世界姓名消歧任务中的总体F-measure是多少?

主要发现

  • 当合并所有关键词时,该方法的平均F-measure达到0.36,表明在消歧任务中表现中等。
  • 关键词'science'的召回率最高,达0.46,但精确率仅为0.10,表明存在大量误报。
  • 关键词'computer'的精确率最高,达0.40,但召回率仅为0.23,反映出精确率与召回率之间的权衡。
  • 关键词'Malaysia'表现出较均衡的性能,召回率为0.40,精确率为0.20,F-measure为0.27。
  • 所有关键词的组合实现了最佳总体F-measure 0.36,表明关键词融合可提升消歧准确率。
  • 该方法表明,从网页片段中基于重叠的关键词提取能有效支持姓名消歧,尤其在组合多个关键词时效果更佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。