[论文解读] Content-Based Citation Recommendation
本文提出了一种基于内容的引用推荐系统,利用文档文本的神经网络嵌入来推荐相关引用,而无需依赖作者或会议等元数据。通过先在学习到的向量空间中选择最近邻,再使用判别模型对候选引用进行重排序,该方法在PubMed和DBLP上实现了最先进性能,F1@20指标优于先前工作18%以上,MRR指标优于22%,即使在缺少元数据的情况下亦然。
We present a content-based method for recommending citations in an academic paper draft. We embed a given query document into a vector space, then use its nearest neighbors as candidates, and rerank the candidates using a discriminative model trained to distinguish between observed and unobserved citations. Unlike previous work, our method does not require metadata such as author names which can be missing, e.g., during the peer review process. Without using metadata, our method outperforms the best reported results on PubMed and DBLP datasets with relative improvements of over 18% in F1@20 and over 22% in MRR. We show empirically that, although adding metadata improves the performance on standard metrics, it favors self-citations which are less useful in a citation recommendation setup. We release an online portal (http://labs.semanticscholar.org/citeomatic/) for citation recommendation based on our method, and a new dataset OpenCorpus of 7 million research articles to facilitate future research on this task.
研究动机与目标
- 为解决在缺乏元数据(如作者姓名、会议名称)的场景中(例如同行评审或研究初期阶段)的引用推荐挑战。
- 开发一种可扩展的、仅基于内容的引用推荐方法,且在向语料库中添加新文档时无需重新训练。
- 通过消除对元数据的依赖,改进现有引用推荐系统,避免因元数据引入的自引用偏差。
- 发布一个大规模、公开可访问的数据集和基于网络的工具,以支持未来在引用推荐领域的研究。
提出的方法
- 该方法仅使用文本内容(标题和摘要)训练的神经网络,将所有文档(包括查询文档)嵌入到共享向量空间中。
- 通过向量空间中的k近邻(KNN)搜索选择候选引用,基于查询文档与候选文档之间的语义相似度。
- 训练一个独立的判别性神经网络,以区分已观察到的引用对(正样本对)与未观察到的引用对(负样本对),输入为查询-文档对。
- 通过小批量随机梯度下降进行训练,从而实现对大规模语料库(如OpenCorpus)的高效扩展。
- 该系统设计为非归纳性:新文档可被嵌入到现有向量空间中,而无需重新训练整个模型。
- 最终的推荐列表通过使用判别模型输出的概率对候选引用进行重排序生成。
实验结果
研究问题
- RQ1仅使用文档的文本内容,能否实现最先进的引用推荐性能,而无需依赖作者或出版场所等元数据?
- RQ2在公平性及避免自引用偏差方面,仅基于内容的引用推荐系统与依赖元数据的基线系统相比表现如何?
- RQ3添加元数据在多大程度上提升了性能?这种性能提升是否以引入不期望的引用偏差为代价?
- RQ4基于神经网络的方法能否在大规模引用推荐任务(如涉及数百万篇文档)中实现高效扩展?
- RQ5与使用剪枝或小规模测试集的先前系统相比,该方法在大规模真实数据集上的表现如何?
主要发现
- 所提出的基于内容的方法在PubMed和DBLP上的最佳报告结果中,F1@20指标提升超过18%,MRR指标提升超过22%,即使完全不使用任何元数据。
- 添加元数据可提升标准指标上的性能,但会引入显著的自引用偏差,而自引用在引用推荐中通常用处不大。
- 即使在缺少元数据的情况下,该方法仍保持稳健且高效,适用于研究初期或同行评审等场景。
- 该系统仅使用文本嵌入就在两个基准数据集上实现了最先进性能,证明了基于内容的表征学习的有效性。
- OpenCorpus数据集(包含700万篇研究论文)的发布,解决了以往数据集的局限性,如规模过小和过度剪枝。
- 在线引用推荐门户citeomatic已公开可用,支持仅基于文本的实时引用建议。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。