[论文解读] Using Rank Aggregation for Expert Search in Academic Digital Libraries
本文提出使用无监督排序聚合方法——具体为 CombSUM 和 CombMNZ——来整合学术数字图书馆中基于文本内容、引用网络和专家档案的多个专家能力评估器。在计算机科学数据集上的实验表明,CombMNZ 的 MAP 达到 0.5832,优于单一特征集,并与监督方法相当,证明了在无标注相关性数据的情况下,基于原理的聚合在专家搜索中的有效性。
The task of expert finding has been getting increasing attention in information retrieval literature. However, the current state-of-the-art is still lacking in principled approaches for combining different sources of evidence. This paper explores the usage of unsupervised rank aggregation methods as a principled approach for combining multiple estimators of expertise, derived from the textual contents, from the graph-structure of the citation patterns for the community of experts, and from profile information about the experts. We specifically experimented two unsupervised rank aggregation approaches well known in the information retrieval literature, namely CombSUM and CombMNZ. Experiments made over a dataset of academic publications for the area of Computer Science attest for the adequacy of these methods.
研究动机与目标
- 为解决在专家发现中缺乏对多样化证据来源进行系统整合的原理性方法的问题。
- 评估无监督排序聚合是否能有效整合基于文本、结构和档案的专家能力评估器。
- 评估 CombSUM 和 CombMNZ 在学术专家搜索中的性能,特别是在缺乏标注相关性数据的情况下。
- 从检索效果角度,比较无监督聚合与监督学习排序方法的性能。
- 确定不同特征类型——文本、网络和档案——对专家排序质量的相对贡献。
提出的方法
- 采用 CombSUM 和 CombMNZ 两种信息检索领域中知名的无监督排序聚合方法。
- 生成多个专家能力评估器:基于文本的相似度(查询-文档)、基于网络中心性的(引用/共引图)以及基于档案的特征(如 H 指数、发表数量)。
- 应用排序聚合,将每个评估器生成的专家独立排序列表合并为一个统一的排序结果。
- 采用标准的信息检索评估指标:P@k 和 MAP,其中相关性由出版物中专家与主题的共现关系定义。
- 使用来自计算机科学领域的学术出版物数据集,包含 DBLP 元数据和引用链接。
- 通过评估不同特征集组合的性能,开展消融研究,以评估各特征的独立贡献。
实验结果
研究问题
- RQ1无监督排序聚合能否有效整合来自文本、网络结构和档案的多样化专家能力评估器?
- RQ2在聚合多个专家能力信号时,CombSUM 和 CombMNZ 的性能表现如何比较?
- RQ3在文本、网络或档案三类特征中,哪一类对专家排序质量的贡献最为显著?
- RQ4无监督聚合能否在专家检索中实现与监督学习排序方法相媲美的性能?
- RQ5结合不同特征集对检索效果的影响如何,以 P@k 和 MAP 衡量?
主要发现
- CombMNZ 表现优于 CombSUM,MAP 达到 0.5832,高于任何单一特征集,并与监督方法相当。
- 仅使用网络特征时表现最佳(MAP = 0.5990),表明引用和共引模式是专家能力的强指标。
- 仅使用文本相似度特征时表现最弱(MAP = 0.5538),表明仅靠内容不足以实现准确的专家识别。
- 档案与网络特征的组合达到 MAP 0.5986,表明这两类证据来源之间存在显著协同效应。
- 结合所有特征(文本、档案和网络)的完整模型达到 MAP 0.5832,证明整合多样化证据来源具有显著优势。
- 尽管未使用标注的相关性数据,该无监督方法的性能仍可与 Yang 等人提出的监督方法(MAP = 0.6356)相媲美。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。