Skip to main content
QUICK REVIEW

[논문 리뷰] Augmenting recommendation systems using a model of semantically-related terms extracted from user behavior

Khalifeh AlJadda, Mohammed Korayem|arXiv (Cornell University)|2014. 09. 08.
Recommender Systems and Techniques참고 문헌 9인용 수 5
한 줄 요약

이 논문은 대규모 사용자 검색 로그에서 잠재적 의미 관계를 추출하여 추천 시스템을 보완하는 언어에 구애받지 않는 공동 설계 기반 의미 발견 시스템을 제안한다. 확률적 그래픽 모델을 활용한 대규모 계층적 데이터(PGMHD)를 통해 사용자 검색 패턴을 모델링함으로써 의미적으로 관련된 키워드를 추론하고, 사용자 분류를 향상시키며, 최근접 이웃 기반 협업 필터링을 가능하게 하여 발견된 관련 용어의 오차율이 최대 2% 이내로 낮아지는 성과를 달성한다.

ABSTRACT

Common difficulties like the cold-start problem and a lack of sufficient information about users due to their limited interactions have been major challenges for most recommender systems (RS). To overcome these challenges and many similar ones that result in low accuracy (precision and recall) recommendations, we propose a novel system that extracts semantically-related search keywords based on the aggregate behavioral data of many users. These semantically-related search keywords can be used to substantially increase the amount of knowledge about a specific user's interests based upon even a few searches and thus improve the accuracy of the RS. The proposed system is capable of mining aggregate user search logs to discover semantic relationships between key phrases in a manner that is language agnostic, human understandable, and virtually noise-free. These semantically related keywords are obtained by looking at the links between queries of similar users which, we believe, represent a largely untapped source for discovering latent semantic relationships between search terms.

연구 동기 및 목표

  • 제한된 사용자 상호작용 데이터로 인해 추천 정확도가 낮아지는 추천 시스템의 쿨스타트 문제를 해결한다.
  • 기존 협업 필터링과 콘텐츠 기반 필터링의 한계를 극복하기 위해 집합된 사용자 행동 데이터를 활용해 검색어 간 의미 관계를 추론한다.
  • 언어별 자연어 처리(NLP)에 의존하지 않고도 수십억 개의 검색 쿼리에서 도메인 특화 의미 관계를 스케일러블하게 발견하는 언어에 구애받지 않는 방법을 개발한다.
  • 의미적으로 관련된 키워드로 사용자 프로필을 보강하고 검색 패턴 기반 사용자 분류를 통해 추천 정밀도를 향상시킨다.
  • 사용자 분류 클러스터 내에서 최근접 이웃 선택을 통해 의미 보강을 협업 필터링에 통합하여 추천을 정교화한다.

제안 방법

  • 대규모 계층적 데이터를 위한 확률적 그래픽 모델(PGMHD)을 사용해 사용자 검색 로그를 모델링하고 키워드 간 의미 관계를 추론한다.
  • 사용자 분류, 검색어 추출, 사용자별 어휘 집합화, 분류 정보와 검색어 데이터 통합을 통해 검색 로그를 사전 처리한다.
  • 유사 사용자들의 쿼리에서 동시 발생 패턴을 분석함으로써 의미 관계를 식별하는 공동 설계된 잠재 의미 발견 엔진을 적용한다.
  • PGMHD를 사용해 사용자 분류 확률 점수를 계산하고, 가장 높은 점수를 받은 분류를 추천 공간을 제한하는 데 사용한다.
  • 검색 키워드의 벡터 표현과 거리 측정 기준(예: 해밍 거리, 유클리드 거리)을 활용해 최상위 분류 내에서 유사 사용자를 식별하는 k-최근접 이웃(k-NN) 기반 접근법을 구현한다.
  • 신뢰도 기준과 이웃 가용성에 따라 검색 쿼리 보강, 사용자 분류 보강, 또는 최근접 이웃 보강 중 최적의 추천 전략을 동적으로 선택하는 증강 엔진(AE)을 설계한다.

실험 결과

연구 질문

  • RQ1언어별 자연어 처리(NLP)에 의존하지 않고 집합된 사용자 행동 데이터로부터 검색어 간 의미 관계를 효과적으로 발견할 수 있는가?
  • RQ2대규모 사용자 검색 로그에서 추출한 잠재적 의미 관계가 추천 시스템의 정확도, 특히 쿨스타트 상황에서 향상시키는 데 얼마나 기여하는가?
  • RQ3검색 패턴 기반 사용자 분류와 의미 키워드 보강을 조합했을 때 추천 정밀도 향상에 어느 정도 기여하는가?
  • RQ4가장 높은 확률 분류 클러스터 내 사용자에 국한해 검색 공간을 제한함으로써 최근접 이웃 기반 협업 필터링을 얼마나 향상시킬 수 있는가?
  • RQ5대규모 직업 포털의 실제 검색 로그를 기반으로 검증했을 때, 발견된 의미 관계의 오차율은 얼마인가?

주요 결과

  • 시스템은 16억 건의 검색 로그에서 의미적으로 관련된 키워드를 성공적으로 발견했으며, 콘텐츠 기반 필터링 검증에서 최대 2% 이내의 오차율을 기록했다.
  • 의미 발견 엔진은 '하이도프'가 '빅데이터', '자바', '파이썬'과 연결되는 등 인간이 이해할 수 있는 의미 관계를 효과적으로 식별했다.
  • PGMHD 모델은 확장 가능하고 언어에 구애받지 않는 사용자 의도 및 분류 추론을 가능하게 했으며, 확률 점수를 활용해 추천 공간을 제한하는 데 기여했다.
  • 최상위 사용자 분류 내에서 최근접 이웃 보강을 통합함으로써 가장 유사한 사용자에게 집중함으로써 추천 정밀도가 향상되었다.
  • 증강 엔진은 신뢰도와 이웃 가용성에 기반해 검색 쿼리 보강, 사용자 분류 보강, 또는 최근접 이웃 보강 중 최적의 추천 전략을 동적으로 선택한다.
  • 시스템은 CareerBuilder의 실생산 환경에서 실용성을 입증했으며, 시간당 100만 건 이상의 검색과 수백만 개의 직업 공고 및 이력서를 지원했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.