Skip to main content
QUICK REVIEW

[论文解读] Clustering of scientific citations in Wikipedia

Finn Årup Nielsen|arXiv (Cornell University)|Jan 1, 2008
Wikis in Education and Collaboration被引用 9
一句话总结

本文提出在维基百科(文章×期刊)引用矩阵上使用非负矩阵分解(NMF),对文章和期刊进行软聚类,揭示潜在的科学主题。主要贡献在于证明维基百科中的引用模式能够有效揭示科学文献中的主题聚类,且聚类结果与学术学科具有有意义的对应关系。

ABSTRACT

The instances of templates in Wikipedia form an interesting data set of structured information. Here I focus on the cite journal template that is primarily used for citation to articles in scientific journals. These citations can be extracted and analyzed: Non-negative matrix factorization is performed on a (article x journal) matrix resulting in a soft clustering of Wikipedia articles and scientific journals, each cluster more or less representing a scientific topic.

研究动机与目标

  • 使用结构化模板数据分析维基百科中科学引用的结构。
  • 通过基于引用模式对维基百科文章和期刊进行聚类,识别潜在的科学主题。
  • 评估维基百科中引用共现是否反映有意义的科学学科。
  • 证明维基百科的引用数据作为科学知识组织的可扩展代理工具的实用性。

提出的方法

  • 从维基百科文章中提取“cite journal”模板,构建(文章×期刊)引用矩阵。
  • 对引用矩阵应用非负矩阵分解(NMF),以识别低秩且非负的成分。
  • 将每个NMF成分解释为一个软聚类,代表一个科学主题,文章和期刊根据引用权重被分配到多个聚类中。
  • 利用所得分解结果,基于共享的引用模式将文章和期刊分组为主题聚类。
  • 通过检查每个聚类中主导期刊和文章的主题相关性,验证聚类的一致性。

实验结果

研究问题

  • RQ1是否可以利用维基百科中的引用模式通过聚类识别出有意义的科学主题?
  • RQ2从维基百科引用中推导出的聚类在多大程度上对应于既定的科学学科?
  • RQ3所生成的软聚类在多大程度上能反映文章和期刊的主题内容?
  • RQ4NMF在揭示维基百科大规模真实世界引用数据中的结构方面效果如何?

主要发现

  • 基于NMF的聚类成功地从维基百科引用模式中识别出不同的科学主题。
  • 每个聚类均包含主题一致的文章和期刊,主导期刊反映了特定领域内的核心出版物。
  • 文章和期刊被分配到多个聚类中,反映出科学研究的跨学科特性。
  • 该方法揭示了维基百科中的引用结构反映了现实世界中的科学领域边界,验证了其作为知识发现工具的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。