[論文レビュー] A Large-Scale Rich Context Query and Recommendation Dataset in Online Knowledge-Sharing
本論文は、10日間にわたりユーザー、質問、回答、トピック、クエリログを含む1億件のインタラクションを含む、Zhihu知識共有プラットフォームからの大規模かつ公開可能なデータセット、ZhihuRecを紹介する。これは、順序付き、文脈に配慮した、および検索統合型の推薦システムを含む、高度な個人向け推薦研究を可能にし、ポジティブおよびネガティブフィードバックの両方をサポートしており、ユーザーパーサイリングおよび品質予測タスクにおける実用性を示している。
Data plays a vital role in machine learning studies. In the research of recommendation, both user behaviors and side information are helpful to model users. So, large-scale real scenario datasets with abundant user behaviors will contribute a lot. However, it is not easy to get such datasets as most of them are only hold and protected by companies. In this paper, a new large-scale dataset collected from a knowledge-sharing platform is presented, which is composed of around 100M interactions collected within 10 days, 798K users, 165K questions, 554K answers, 240K authors, 70K topics, and more than 501K user query keywords. There are also descriptions of users, answers, questions, authors, and topics, which are anonymous. Note that each user's latest query keywords have not been included in previous open datasets, which reveal users' explicit information needs. We characterize the dataset and demonstrate its potential applications for recommendation study. Multiple experiments show the dataset can be used to evaluate algorithms in general top-N recommendation, sequential recommendation, and context-aware recommendation. This dataset can also be used to integrate search and recommendation and recommendation with negative feedback. Besides, tasks beyond recommendation, such as user gender prediction, most valuable answerer identification, and high-quality answer recognition, can also use this dataset. To the best of our knowledge, this is the largest real-world interaction dataset for personalized recommendation.
研究の動機と目的
- 豊富なユーザーインタラクションログと補助情報を持つ大規模で現実世界の推薦データセットの不足を解消すること。
- ソーシャライズド知識共有プラットフォームから、公開可能で包括的なデータセットを提供し、高度な推薦研究を支援すること。
- 順序付き、文脈に配慮した、およびハイブリッド推薦モデルの研究、ならびに検索-推薦統合とユーザービヘイビアーモデリングの研究を可能にすること。
- 推薦を越えたタスク、例えば性別予測、高品質回答の認識、最優秀回答者特定の支援。
- ポジティブおよびネガティブフィードバックを備えたベンチマークデータセットを提供し、推薦アルゴリズムの評価を向上させること。
提案手法
- データセットZhihuRecは、10日間にわたりZhihuから収集され、クリック、スキップ、検索、推薦などのユーザーインタラクションを含む。
- 匿名化されたユーザープロフィール、質問、回答、著者、トピック、タイムスタンプを含む、詳細なコンテンツ特徴が含まれる。
- 従来のオープンデータセットに欠けていたユーザーのクエリキーワードが含まれており、明示的な情報ニーズを示している。
- トップ-N、順序付き、文脈に配慮した、およびネガティブフィードバックを考慮した学習という複数の推薦パラダイムをサポートする。
- クエリログと推薦インタラクションログの両方を保持することで、検索と推薦の統合を可能にする。
- GitHub経由で公開されており、scikit-learnおよびディープラーニングモデルを用いた標準的なMLパイプラインで下流タスクをサポートする。
実験結果
リサーチクエスチョン
- RQ1豊富なインタラクションログとクエリ行動を備えた大規模で現実世界のデータセットは、推薦アルゴリズムの評価をどのように改善できるか?
- RQ2クエリログとネガティブフィードバックは、順序付きおよび文脈に配慮した推薦モデルをどの程度向上できるか?
- RQ3このデータセットは、知識共有プラットフォームにおける検索と推薦システムの統合を支援できるか?
- RQ4性別予測や最優秀回答者特定といったユーザーパーサイリングタスクにおいて、このデータセットはどの程度有効か?
- RQ5このデータセットは、高品質回答認識のためのモデルの訓練および評価に使用できるか?
主な発見
- ZhihuRecは、これまでで最大の公開利用可能な推薦データセットであり、79万8千人のユーザー、16万5千件の質問、55万4千件の回答、24万の著者を含む1億件のインタラクションを有する。
- このデータセットは、従来のオープンデータセットに欠けていたユーザーのクエリログを含んでおり、ユーザーの情報ニーズを明示的にモデル化可能である。
- 実験の結果、このデータセットはトップ-N、順序付き、文脈に配慮した推薦アルゴリズムの効果的評価を可能にしている。
- ポジティブおよびネガティブフィードバック(例:クリックとスキップ)の両方を含むことで、ワンクラス問題に対応するモデルの強固な訓練が可能になった。
- 最優秀回答者特定のタスクにおいて、MLPモデルは最高のF1スコア0.6648を達成し、ユーザーデータの質の予測において優れたパフォーマンスを示した。
- 高品質回答認識のタスクにおいて、MLPモデルはF1スコア0.3913を達成し、コンテンツ品質モデリングにおけるデータセットの有用性を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。