[论文解读] Using Access Data for Paper Recommendations on ArXiv.org
本硕士论文提出了一种针对 arXiv.org 的推荐系统,利用访问日志数据(如共同访问和下载模式)识别相关科学论文,从而无需依赖成本高昂的引用提取。该系统性能强劲,与基于引用的方法相当,证明了访问日志中的隐式用户行为可有效替代显式元数据,用于个性化文献发现。
This thesis investigates in the use of access log data as a source of information for identifying related scientific papers. This is done for arXiv.org, the authority for publication of e-prints in several fields of physics. Compared to citation information, access logs have the advantage of being immediately available, without manual or automatic extraction of the citation graph. Because of that, a main focus is on the question, how far user behavior can serve as a replacement for explicit meta-data, which potentially might be expensive or completely unavailable. Therefore, we compare access, content, and citation-based measures of relatedness on different recommendation tasks. As a final result, an online recommendation system has been built that can help scientists to find further relevant literature, without having to search for them actively.
研究动机与目标
- 探究访问日志数据是否可作为识别 arXiv.org 上相关科学论文的可行且低成本替代方案。
- 评估基于访问的度量方法(如共访问、共下载)与基于内容的(TF·IDF)和基于引用的(共引用)相似性度量在文献推荐任务中的有效性。
- 开发并部署一个在线推荐系统,基于用户访问模式主动推荐相关论文。
- 评估将隐式用户行为作为专家知识代理用于科学文献推荐的可行性。
- 探索在缺乏新发表或未被引用论文的引用数据时,基于访问日志的推荐在可扩展性和鲁棒性方面的表现。
提出的方法
- 收集并处理了 arXiv.org 的访问日志,包括用户会话数据、页面浏览和下载事件。
- 定义了共访问和共下载度量方法,以捕捉用户行为模式,其中若两篇论文在同一会话中被访问,则视为相关。
- 应用基于时间的过滤策略,排除自动化访问(如机器人流量),并采用基于会话的共现机制以降低噪声。
- 采用基于会话的共访问算法,通过检查访问的时间接近性来推断有意义的用户驱动关系。
- 在标准推荐任务上评估了多种相似性度量方法——TF·IDF(内容)、共引用(引用)和共下载(访问)——的表现。
- 采用基于访问数据的协同过滤方法生成个性化推荐,无需显式用户评分。
实验结果
研究问题
- RQ1访问日志数据在多大程度上可单独替代引用数据,用于识别 arXiv.org 上的相关科学论文?
- RQ2在文献推荐任务中,基于访问的度量方法(如共访问、共下载)与基于内容的(TF·IDF)和基于引用的(共引用)方法相比,性能如何?
- RQ3访问日志中的用户行为模式是否能可靠指示科学相关性,即使对于无引用的论文?
- RQ4过滤自动化访问(如机器人)对基于访问的推荐质量与稳定性有何影响?
- RQ5完全基于访问数据构建的推荐系统在提升相关科学文献发现方面有多有效?
主要发现
- 访问日志数据,尤其是共访问和共下载模式,生成的推荐结果与基于引用的方法相当,尤其在引用较少或无引用的论文中表现更优。
- 共访问度量——基于用户在同一会话中浏览多篇论文的模式——表现强劲,且比原始下载次数更不易受噪声影响。
- 过滤掉机器人和自动化流量后,访问分布更加平滑稳定,提升了基于访问信号的可靠性。
- 该系统表明,隐式用户行为可有效替代显式元数据(如引用),尤其在引用数据稀疏或不可用的情况下。
- 最终的在线推荐系统成功以高精度识别出相关论文,显著减少了研究人员主动搜索的需求。
- 共引用和共引用度量在捕捉非显而易见但相关联的论文关系方面,表现不如基于访问的度量方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。