Skip to main content
QUICK REVIEW

[논문 리뷰] Generating ordered list of Recommended Items: a Hybrid Recommender System of Microblog

Yingzhen Li, Ye Zhang|arXiv (Cornell University)|2012. 08. 21.
Recommender Systems and Techniques참고 문헌 6인용 수 4
한 줄 요약

이 논문은 텐센트 마이크로블로그를 위한 하이브리드 추천 시스템을 제안하며, 키워드 분석, 사용자 분류 체계, 관심사 추출을 통합하여 개인화된 순서 정렬된 사용자 추천 리스트를 생성한다. 인기, 유사성, 사용자 행동 패턴을 통합함으로써 KDD 컵 2012 데이터에서 상위 3개 추천에서 평균 정밀도(MAP)가 0.41198에 도달하여 기준 방법들을 능가한다.

ABSTRACT

Precise recommendation of followers helps in improving the user experience and maintaining the prosperity of twitter and microblog platforms. In this paper, we design a hybrid recommender system of microblog as a solution of KDD Cup 2012, track 1 task, which requires predicting users a user might follow in Tencent Microblog. We describe the background of the problem and present the algorithm consisting of keyword analysis, user taxonomy, (potential)interests extraction and item recommendation. Experimental result shows the high performance of our algorithm. Some possible improvements are discussed, which leads to further study.

연구 동기 및 목표

  • 텐센트 마이크로블로그에서 추천 수락률이 낮고 추천이 오래된 문제를 해결하기 위해 강력한 하이브리드 추천 시스템을 구축하기 위해.
  • 대규모 마이크로블로그 환경에서 사용자 행동, 관심사, 콘텐츠 의미를 모델링하여 추천 정밀도를 향상시키기 위해.
  • 사용자 선호도와 항목의 인기도를 반영한 순서 정렬된 개인화된 추천 리스트를 생성하기 위해.
  • 단일 방법 추천 시스템의 한계를 극복하기 위해 콘텐츠 기반, 협업 필터링, 인기 기반 신호를 융합하기 위해.

제안 방법

  • 사용자 관심사를 유추하기 위해 키워드 연관성과 동의어를 효율적이고 병렬적으로 추출하기 위해 개선된 FDM 알고리즘을 적용하였다.
  • 상호작용 빈도와 행동 패턴을 기반으로 사용자를 활성, 비활성, 가짜로 분류하여 사용자 분류 체계를 수립하였다.
  • 리트윗/댓글 수를 통해 인기도를 측정하고 공통 키워드를 기반으로 유사도를 계산하여 사용자 순위를 매기는 등급 함수를 정의하였다.
  • 사용자 간 상호작용 강도를 정량화하기 위해 가중치 기반 상호작용 점수 $fami(u_j, u_k) = \frac{1}{3} \times (\text{at} + \text{retweet} + \text{comment})$ 를 사용하였다.
  • 전체 재학습 없이도 변화하는 사용자 관심사를 반영하기 위해 확률적 재학습 기법을 적용하였다.
  • 카테고리, 인기도, 유사도를 기반으로 복합 등급 함수를 사용하여 후보 사용자를 정렬함으로써 순서 정렬된 추천 리스트를 생성하였다.

실험 결과

연구 질문

  • RQ1키워드 분석과 동의어 추출 기법을 대규모 마이크로블로그 데이터에 효과적으로 스케일링하여 관심사 추론에 활용할 수 있는가?
  • RQ2사용자 분류(활성/비활성/가짜)가 사용자 팔로우 추천 정확도에 어느 정도 기여하는가?
  • RQ3인기, 유사성, 사용자 행동을 융합한 하이브리드 모델이 전통적인 협업 필터링 또는 콘텐츠 기반 방법보다 마이크로블로그 추천에서 뛰어난 성능을 내는가?
  • RQ4동적인 사용자 행동과 변화하는 콘텐츠에 대비하여 시스템은 추천의 관련성을 어떻게 유지하는가?

주요 결과

  • 모든 사용자 유형에서 평균 정밀도(MAP@3)가 0.41198로 나타나 KDD 컵 2012 벤치마크에서 뛰어난 전반적 성능을 보였다.
  • 비활성 사용자(0.46879)는 활성 사용자(0.41066)보다 더 높은 정밀도를 보였으며, 예측된 팔로우 행동과 실제 행동 간의 일치도가 높음을 시사한다.
  • 가짜 사용자(0.33606)는 가장 낮은 정밀도를 보였으며, 낮거나 허위 활동으로 인해 관심사 추론에 어려움이 있음을 나타낸다.
  • 비활성 사용자 942226은 상위 3개 추천에서 완벽한 AP@3(1.00)를 기록하여 해당 사용자에 대한 추천 정확도가 매우 높음을 보였다.
  • 활성 사용자 2071402는 AP@3가 0.83을 기록하여 높은 인기도 편향에도 불구하고 뛰어난 성능을 보였다.
  • 비활성 사용자의 팔로잉 대상에서 잠재적 관심사를 추출함으로써 성능 향상이 이루어졌으며, 간접적 선호도 모델링의 가치를 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.