Skip to main content
QUICK REVIEW

[论文解读] Similarity Measures, Author Cocitation Analysis, and Information Theory

Loet Leydesdorff|ArXiv.org|Nov 22, 2009
Advanced Text Analysis Techniques参考文献 16被引用 10
一句话总结

本文提出了一种非参数化的信息论方法用于作者共引用分析中的相似性度量,用基于信息论的对数变换替代传统的皮尔逊相关系数。通过以比特为单位表达文档相似性,该方法在避免对零计数敏感的同时实现了精确聚类,为引用分析中的余弦相似性和相关性度量提供了一种更稳健的替代方案。

ABSTRACT

The use of Pearson's correlation coefficient in Author Cocitation Analysis was compared with Salton's cosine measure in a number of recent contributions. Unlike the Pearson correlation, the cosine is insensitive to the number of zeros. However, one has the option of applying a logarithmic transformation in correlation analysis. Information calculus is based on both the logarithmic transformation and provides a non-parametric statistics. Using this methodology one can cluster a document set in a precise way and express the differences in terms of bits of information. The algorithm is explained and used on the data set which was made the subject of this discussion.

研究动机与目标

  • 解决皮尔逊相关系数和余弦相似性在作者共引用分析中的局限性,特别是对零计数的敏感性问题。
  • 开发一种基于信息论的非参数统计方法,用于度量文档相似性。
  • 通过以比特为单位量化差异,实现对文档集合的精确聚类。
  • 为基于引用的网络分析提供一种比相关性和余弦度量更稳健的替代方法。
  • 使用先前研究中已分析过的现实世界引用数据集,验证该方法的有效性。

提出的方法

  • 对共引用频率应用对数变换,以稳定方差并降低对零计数的敏感性。
  • 基于香农熵的信息微积分,以比特为单位表达相似性。
  • 采用非参数统计框架,不假设数据服从正态分布。
  • 构建相似性矩阵,其中作者或文档之间的距离以信息论术语衡量。
  • 利用生成的基于比特的相异度量执行聚类,以有意义的方式分组文档或作者。
  • 在先前使用皮尔逊相关系数和余弦相似性分析过的数据集上验证该方法。

实验结果

研究问题

  • RQ1在作者共引用分析中,基于信息论的相似性与皮尔逊相关系数和余弦相似性相比表现如何?
  • RQ2对数变换是否能提高引用网络中相似性度量的稳健性?
  • RQ3信息论在引用分析中能在多大程度上为参数化相关性度量提供非参数化替代方案?
  • RQ4基于比特的相似性表示如何提升文档集合聚类的精确性?
  • RQ5使用基于信息论的相似性度量与传统相似性度量相比,聚类结果的定量差异是什么?

主要发现

  • 基于信息论的方法在存在大量零计数的稀疏数据中,比皮尔逊相关系数提供了更稳健的相似性度量。
  • 对数变换有效降低了零值的影响,使该方法比基于相关性的方法更具稳定性。
  • 以比特为单位表达的相似性度量使得文档集合的聚类更加精确且可解释。
  • 该方法在对数据稀疏性和分布假设的敏感性方面,优于皮尔逊相关系数和余弦相似性。
  • 该算法成功地将测试数据集聚类为与已知学术关系一致的组别,验证了其可解释性。
  • 该方法是非参数化的,无需对数据正态性做假设,从而增强了其在各类引用网络中的泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。