[论文解读] A framework for constructing a huge name disambiguation dataset: algorithms, visualization and human collaboration
本文提出了 WhoisWho,这是迄今为止最大规模的手动标注作者姓名消歧数据集,包含 399,255 篇文档和 45,187 位作者。该研究提出了一种结合图神经网络、可视化和投票机制的协作标注框架,以提升标注效率与准确性,在消歧任务中错误率低于 5%,并优于当前最先进的方法。
We present a manually-labeled Author Name Disambiguation(AND) Dataset called WhoisWho, which consists of 399,255 documents and 45,187 distinct authors with 421 ambiguous author names. To label such a great amount of AND data of high accuracy, we propose a novel annotation framework where the human and computer collaborate efficiently and precisely. Within the framework, we also propose an inductive disambiguation model to classify whether two documents belong to the same author. We evaluate the proposed method and other state-of-the-art disambiguation methods on WhoisWho. The experiment results show that: (1) Our model outperforms other disambiguation algorithms on this challenging benchmark. (2) The AND problem still remains largely unsolved and requires more in-depth research. We believe that such a large-scale benchmark would bring great value for the author name disambiguation task. We also conduct several experiments to prove our annotation framework could assist annotators to make accurate results efficiently and eliminate wrong label problems made by human annotators effectively.
研究动机与目标
- 为解决作者姓名消歧(AND)领域缺乏大规模、高质量基准的问题,该问题限制了数据驱动模型的发展。
- 开发一种高效且准确的标注框架,以减少在标注模糊作者姓名时的人工错误与工作量。
- 构建一个大规模、多样化且准确的数据集(WhoisWho),以支持未来 AND 领域的研究。
- 在新基准上评估一种新型归纳式图神经网络模型相较于当前最先进方法的性能表现。
- 证明即使最先进的自动化模型在真实世界大规模数据上仍与人类表现存在显著差距,凸显 AND 问题的开放性挑战。
提出的方法
- 提出一种协作式标注框架,将消歧任务划分为多个阶段,降低认知负荷,支持并行处理与可聚合的工作流。
- 采用有监督的归纳式图神经网络(GNN)模型,预测两篇文档是否指向同一作者,利用相似性图中的节点与边特征。
- 在 GNN 预测的相似性分数上应用社区检测算法,生成初始的消歧聚类结果。
- 集成可视化工具,通过展示文档间关系与聚类结构,辅助标注者决策。
- 在验证阶段应用投票策略,以检测并排除错误分配的文档,提升结果准确性。
- 将标注过程划分为独立阶段——创建、验证与冲突解决,实现可扩展的协作标注,最大限度减少人为错误。
实验结果
研究问题
- RQ1可扩展的协作式标注框架是否能显著提升大规模作者姓名消歧的效率与准确性?
- RQ2基于归纳式 GNN 的消歧模型在大规模复杂基准上与当前最先进方法相比表现如何?
- RQ3人类标注者在孤立工作时会犯多大程度的错误?这些错误能否通过协作工作流被有效检测与纠正?
- RQ4在真实世界大规模数据上,最佳自动化消歧模型与人类表现之间的差距有多大?
- RQ5所提出的框架是否能扩展以处理日益庞大和复杂的文档集合,而不会导致性能下降?
主要发现
- 所提出的归纳式 GNN 模型在 WhoisWho 基准上优于所有当前最先进方法,相比次优方法提升 2.28%。
- 直接将边特征输入 GNN 解码器,相较于基线配置,性能分别提升 13.54% 和 10.71%。
- 在验证阶段,被排除的错误分配文档比例在大多数文档集中低于 5%,表明在该框架下标注者个体的准确性较高。
- 在创建阶段的冲突对比例在不同规模的文档集中均保持较低且稳定,证实了该框架的可扩展性及对轻微标注错误的鲁棒性。
- 在系统支持下,标注者每小时可完成 600 至 700 篇文档的标注,展示了协作工作流中的高效率。
- 尽管模型性能强劲,但最佳模型与人类表现之间仍存在显著差距,确认 AND 问题在很大程度上仍未解决。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。