[논문 리뷰] A Large-Scale Rich Context Query and Recommendation Dataset in Online Knowledge-Sharing
이 논문은 지푸 지식공유 플랫폼에서 수집한 대규모 공개 데이터셋인 지푸렉(ZhihuRec)을 소개한다. 이 데이터셋은 10일 간 사용자, 질문, 답변, 주제, 쿼리 로그 간의 100만 건의 상호작용을 포함한다. 이는 순차적, 맥락 인지형, 검색 통합형 추천 시스템을 포함한 고도화된 개인화 추천 연구를 가능하게 하며, 양성 및 부정성 피드백을 모두 지원하며, 사용자 프로파일링 및 품질 예측 작업에서의 유용성을 입증한다.
Data plays a vital role in machine learning studies. In the research of recommendation, both user behaviors and side information are helpful to model users. So, large-scale real scenario datasets with abundant user behaviors will contribute a lot. However, it is not easy to get such datasets as most of them are only hold and protected by companies. In this paper, a new large-scale dataset collected from a knowledge-sharing platform is presented, which is composed of around 100M interactions collected within 10 days, 798K users, 165K questions, 554K answers, 240K authors, 70K topics, and more than 501K user query keywords. There are also descriptions of users, answers, questions, authors, and topics, which are anonymous. Note that each user's latest query keywords have not been included in previous open datasets, which reveal users' explicit information needs. We characterize the dataset and demonstrate its potential applications for recommendation study. Multiple experiments show the dataset can be used to evaluate algorithms in general top-N recommendation, sequential recommendation, and context-aware recommendation. This dataset can also be used to integrate search and recommendation and recommendation with negative feedback. Besides, tasks beyond recommendation, such as user gender prediction, most valuable answerer identification, and high-quality answer recognition, can also use this dataset. To the best of our knowledge, this is the largest real-world interaction dataset for personalized recommendation.
연구 동기 및 목표
- 풍부한 사용자 상호작용 로그와 부가 정보를 갖춘 대규모 실세계 추천 데이터셋의 부족 문제를 해결하기 위해.
- 사회화된 지식공유 플랫폼에서 유래한 공개적이고 종합적인 데이터셋을 제공하여 고도화된 추천 연구를 지원하기 위해.
- 순차적, 맥락 인지형, 하이브리드 추천 모델 연구뿐만 아니라 검색-추천 통합 및 사용자 행동 모델링 연구를 가능하게 하기 위해.
- 추천을 넘어서 성별 예측, 고품질 답변 식별, 최고가치 기여자 식별 등의 작업을 지원하기 위해.
- 개선된 추천 알고리즘 평가를 위해 음성 및 양성 피드백을 모두 포함한 기준 데이터셋을 제공하기 위해.
제안 방법
- 데이터셋인 지푸렉은 10일 간 지푸에서 수집되었으며, 클릭, 스킵, 검색, 추천 등의 사용자 상호작용을 포괄한다.
- 익명화된 사용자 프로필, 질문, 답변, 저자, 주제, 타임스탬프를 포함한 세부적인 콘텐츠 특징이 포함되어 있다.
- 이전에 오픈 데이터셋에 존재하지 않았던 사용자 쿼리 키워드가 포함되어 있어, 명시적인 정보 필요성을 드러낸다.
- 상위-N, 순차적, 맥락 인지형, 음성 피드백 인지형 학습을 포함한 다양한 추천 파라다임을 지원한다.
- 쿼리 로그와 추천 상호작용 로그를 모두 유지함으로써 검색과 추천의 통합을 가능하게 한다.
- GitHub 경유로 공개 배포되며, scikit-learn 및 딥러닝 모델을 사용한 표준 머신러닝 파ip라인을 통한 후속 작업을 지원한다.
실험 결과
연구 질문
- RQ1풍부한 상호작용 로그와 쿼리 행동을 포함한 대규모 실세계 데이터셋은 추천 알고리즘 평가를 어떻게 향상시킬 수 있는가?
- RQ2쿼리 로그와 음성 피드백은 순차적 및 맥락 인지형 추천 모델에 얼마나 기여하는가?
- RQ3이 데이터셋은 지식공유 플랫폼에서 검색 및 추천 시스템의 통합을 지원할 수 있는가?
- RQ4성별 예측 및 최고가치 기여자 식별과 같은 사용자 프로파일링 작업에서 이 데이터셋은 얼마나 효과적인가?
- RQ5이 데이터셋은 고품질 답변 식별을 위한 모델 훈련 및 평가에 사용될 수 있는가?
주요 결과
- 지푸렉은 지금까지 공개된 바 있는 가장 대규모의 추천 데이터셋으로, 79만 8천 명의 사용자, 16만 5천 개의 질문, 55만 4천 개의 답변, 24만 명의 저자와 함께 총 1억 건의 상호작용을 포함한다.
- 이전 오픈 데이터셋에 존재하지 않았던 사용자 쿼리 로그를 포함하고 있어, 사용자 정보 필요성을 명시적으로 모델링할 수 있다.
- 실험 결과, 이 데이터셋은 상위-N, 순차적, 맥락 인지형 추천 알고리즘의 효과적인 평가를 가능하게 한다.
- 양성 및 음성 피드백(예: 클릭 및 스킵)의 포함으로 인해, 일류 문제를 다루는 모델의 강건한 훈련이 가능해진다.
- 최고가치 기여자 식별 작업에서 MLP 모델은 F1 스코어 0.6648을 기록하여 사용자 품질 예측에서 뛰어난 성능을 보였다.
- 고품질 답변 식별 작업에서 MLP 모델은 F1 스코어 0.3913을 기록하여, 이 데이터셋이 콘텐츠 품질 모델링에 실용적임을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.