Skip to main content
QUICK REVIEW

[论文解读] A Large-Scale Rich Context Query and Recommendation Dataset in Online Knowledge-Sharing

Bin Hao, Min Zhang|arXiv (Cornell University)|Jun 11, 2021
Recommender Systems and Techniques参考文献 31被引用 6
一句话总结

本论文介绍了 ZhihuRec,这是一个来自知乎知识分享平台的大规模、公开可用的数据集,涵盖10天内用户、问题、回答、话题和查询日志之间的1亿次交互。该数据集支持个性化推荐的前沿研究,包括序列化、上下文感知以及搜索集成系统,支持正负反馈,并在用户画像和质量预测任务中展现出实用性。

ABSTRACT

Data plays a vital role in machine learning studies. In the research of recommendation, both user behaviors and side information are helpful to model users. So, large-scale real scenario datasets with abundant user behaviors will contribute a lot. However, it is not easy to get such datasets as most of them are only hold and protected by companies. In this paper, a new large-scale dataset collected from a knowledge-sharing platform is presented, which is composed of around 100M interactions collected within 10 days, 798K users, 165K questions, 554K answers, 240K authors, 70K topics, and more than 501K user query keywords. There are also descriptions of users, answers, questions, authors, and topics, which are anonymous. Note that each user's latest query keywords have not been included in previous open datasets, which reveal users' explicit information needs. We characterize the dataset and demonstrate its potential applications for recommendation study. Multiple experiments show the dataset can be used to evaluate algorithms in general top-N recommendation, sequential recommendation, and context-aware recommendation. This dataset can also be used to integrate search and recommendation and recommendation with negative feedback. Besides, tasks beyond recommendation, such as user gender prediction, most valuable answerer identification, and high-quality answer recognition, can also use this dataset. To the best of our knowledge, this is the largest real-world interaction dataset for personalized recommendation.

研究动机与目标

  • 为解决缺乏大规模、真实世界推荐数据集,且缺乏丰富用户交互日志和辅助信息的问题。
  • 提供一个来自社交化知识分享平台的公开、全面的数据集,以支持高级推荐研究。
  • 支持序列化、上下文感知以及混合推荐模型的研究,以及搜索-推荐融合和用户行为建模。
  • 支持推荐之外的任务,例如性别预测、高质量回答识别以及最具价值回答者识别。
  • 提供一个包含正负反馈的基准数据集,以提升推荐算法的评估效果。

提出的方法

  • 该数据集 ZhihuRec 从知乎平台采集,覆盖10天时间,记录了包括点击、跳过、搜索和推荐在内的用户交互行为。
  • 包含详细的文本特征:匿名化用户资料、问题、回答、作者、话题以及时间戳。
  • 用户查询关键词——此前在公开数据集中缺失——被纳入其中,揭示了用户的明确信息需求。
  • 该数据集支持多种推荐范式:Top-N、序列化、上下文感知以及负反馈感知学习。
  • 通过保留查询日志和推荐交互日志,支持搜索与推荐系统的融合。
  • 该数据集通过 GitHub 公开发布,支持使用标准机器学习流程(如 scikit-learn)和深度学习模型进行下游任务。

实验结果

研究问题

  • RQ1一个包含丰富交互日志和查询行为的大规模真实世界数据集,能在多大程度上提升推荐算法的评估效果?
  • RQ2查询日志和负反馈在多大程度上能增强序列化和上下文感知推荐模型?
  • RQ3该数据集能否支持知识分享平台中搜索与推荐系统的融合?
  • RQ4该数据集在用户画像任务(如性别预测和最具价值回答者识别)中的有效性如何?
  • RQ5该数据集能否用于训练和评估高质量回答识别模型?

主要发现

  • ZhihuRec 是迄今为止最大的公开推荐数据集,包含 1 亿次交互,涉及 79.8 万名用户、16.5 万个问题、55.4 万个回答以及 24 万名作者。
  • 该数据集包含用户查询日志,这一特征在以往公开数据集中缺失,使用户信息需求的显式建模成为可能。
  • 实验表明,该数据集支持对 Top-N、序列化和上下文感知推荐算法的有效评估。
  • 正负反馈(如点击和跳过)的并存,使模型能够稳健地处理单类问题。
  • 在最具价值回答者识别任务中,MLP 模型取得了 0.6648 的最高 F1 分数,表明其在用户质量预测方面表现优异。
  • 在高质量回答识别任务中,MLP 模型取得了 0.3913 的 F1 分数,证明了该数据集在内容质量建模方面的实用性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。