Skip to main content
QUICK REVIEW

[论文解读] Combining Structured Corporate Data and Document Content to Improve Expertise Finding

Alistair McLean, Mingfang Wu|ArXiv.org|Sep 2, 2005
Expert finding and Q&A systems参考文献 12被引用 4
一句话总结

本文提出了一种混合专家发现系统,通过加权融合模型将结构化企业数据(例如组织架构、职位名称)与非结构化文档内容(例如电子邮件、报告)相结合,以提高专家检索的精确度。在真实企业数据上的评估表明,引入组织结构可显著提升精确度,且研究证明单一数据源或加权方案无法适用于所有场景,强调了针对信息空间进行定制化分析的必要性。

ABSTRACT

In this paper, we present an algorithm for automatically building expertise evidence for finding experts within an organization by combining structured corporate information with different content. We also describe our test data collection and our evaluation method. Evaluation of the algorithm shows that using organizational structure leads to a significant improvement in the precision of finding an expert. Furthermore we evaluate the impact of using different data sources on the quality of the results and conclude that Expert Finding is not a "one engine fits all" solution. It requires an analysis of the information space into which a solution will be placed and the appropriate selection and weighting scheme of the data sources.

研究动机与目标

  • 解决在大型组织中利用结构化与非结构化数据源准确识别内部专家的挑战。
  • 评估不同数据源(尤其是组织结构)对提升专家发现系统精确度的贡献。
  • 开发并验证一种加权融合模型,将结构化企业数据与文档内容结合用于专家推荐。
  • 证明专家发现并非‘一刀切’问题,需根据信息空间特性进行定制化的数据源选择与加权。

提出的方法

  • 作者设计了一种混合专家发现算法,结合来自结构化企业数据(例如职位名称、部门隶属关系)和文档内容(例如电子邮件、报告中的文本)的证据。
  • 采用加权融合模型整合来自多个数据源的信号,其中权重根据各源的相关性与可靠性确定。
  • 通过聚合文档内容的证据(使用TF-IDF或类似IR技术)和结构化元数据(例如层级位置、角色)来计算专家评分。
  • 构建了一个包含员工档案、文档及已知专家指派关系的真实企业数据测试集用于评估。
  • 评估采用基于精确度的指标,比较包含与不包含结构化数据的模型的检索性能。

实验结果

研究问题

  • RQ1引入结构化企业数据在多大程度上提升了专家发现系统的精确度?
  • RQ2不同数据源(例如职位名称、文档内容)对专家检索性能的相对贡献是什么?
  • RQ3单一统一模型能否有效处理多样化数据源,还是必须采用源特定的加权?
  • RQ4专家发现的有效性是否取决于底层信息空间的特性?

主要发现

  • 引入结构化企业数据显著提升了专家检索的精确度,证明组织上下文可增强排序准确性。
  • 结构化数据与文档内容的融合优于仅依赖文档内容或结构化元数据的模型。
  • 不同数据源对专家检测的贡献各不相同,表明‘一刀切’方法无效。
  • 研究证实,最优性能需要对信息空间进行仔细分析,并合理选择与加权数据源。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。