Skip to main content
QUICK REVIEW

[논문 리뷰] Joint Text Embedding for Personalized Content-based Recommendation

Ting Chen, Liangjie Hong|arXiv (Cornell University)|2017. 06. 04.
Recommender Systems and Techniques참고 문헌 21인용 수 20
한 줄 요약

이 논문은 사용자-아이템 상호작용의 지도 학습 정보와 비지도 학습 텍스트 임베딩을 결합하여, 상호작용 기록이 없는 신규 아이템에 대한 개인화된 콘텐츠 기반 추천을 가능하게 하는 공동 텍스트 임베딩 프레임워크를 제안한다. 상호작용 데이터를 사용하여 사용자 및 텍스트 임베딩을 엔드 투 엔드로 훈련하고, 새로운 조합 모듈을 통해 이를 융합함으로써, 실제 데이터셋에서 추천 성능을 크게 향상시켜 냉각기 추천 분야에서 최고 수준의 성능을 달성한다.

ABSTRACT

Learning a good representation of text is key to many recommendation applications. Examples include news recommendation where texts to be recommended are constantly published everyday. However, most existing recommendation techniques, such as matrix factorization based methods, mainly rely on interaction histories to learn representations of items. While latent factors of items can be learned effectively from user interaction data, in many cases, such data is not available, especially for newly emerged items. In this work, we aim to address the problem of personalized recommendation for completely new items with text information available. We cast the problem as a personalized text ranking problem and propose a general framework that combines text embedding with personalized recommendation. Users and textual content are embedded into latent feature space. The text embedding function can be learned end-to-end by predicting user interactions with items. To alleviate sparsity in interaction data, and leverage large amount of text data with little or no user interactions, we further propose a joint text embedding model that incorporates unsupervised text embedding with a combination module. Experimental results show that our model can significantly improve the effectiveness of recommendation systems on real-world datasets.

연구 동기 및 목표

  • 사용자 상호작용 기록이 없는 신규 아이템에 대한 개인화된 추천에서의 냉각기 문제를 해결하기 위해.
  • 라벨이 붙은(사용자 상호작용) 및 레이블이 없는(대규모 텍스트 코퍼스) 데이터를 모두 활용하여 텍스트의 풍부하고 깊이 있는 표현을 학습함으로써 콘텐츠 기반 추천을 향상시키기 위해.
  • 사용자 임베딩과 텍스트 임베딩 함수를 엔드 투 엔드로 공동으로 학습하는 통합 프레임워크를 개발하여 효과적인 개인화 순위 매기기를 가능하게 하기 위해.
  • 희소한 백오브워즈 표현 방식이나 사전 훈련된 텍스트 임베딩을 활용하지 않는 간단한 신경망에 의존하는 전통적 방법의 한계를 극복하기 위해.
  • 지도 학습 및 비지도 학습 텍스트 임베딩을 효과적으로 융합하여 의미 이해를 향상시키는 조합 모듈을 설계하기 위해.

제안 방법

  • 모델은 사용자 임베딩과 텍스트 시퀀스를 조밀한 벡터로 매핑하는 신경망 기반 텍스트 임베딩 함수를 공동으로 학습한다.
  • 사용자 및 아이템 선호도는 공유된 잠재 공간 내에서 내적 곱 유사도를 통해 모델링되며, 암시적 사용자 피드백을 사용하여 엔드 투 엔드로 훈련된다.
  • 텍스트에서 계층적이고 맥락적인 특징을 포착하기 위해 깊이 있는 신경망(예: CNN)을 텍스트 임베딩 함수로 사용한다.
  • 일반적인 의미 패턴을 포착하기 위해 대규모 비지도 코퍼스에서 사전 훈련된 비지도 텍스트 임베딩 모델을 사용한다.
  • 지난 학습된 지도 학습 텍스트 임베딩과 비지도 학습 텍스트 임베딩을 융합하는 새로운 조합 모듈을 도입하여, 작업 특화 표현과 일반 목적 표현을 모두 활용할 수 있도록 한다.
  • 전체 프레임워크는 상호작용 데이터를 감독 신호로 사용하여 엔드 투 엔드로 훈련되며, 사용자 및 텍스트 표현의 공동 최적화를 가능하게 한다.

실험 결과

연구 질문

  • RQ1사용자 상호작용 데이터와 사전 훈련된 텍스트 임베딩을 융합하는 공동 학습 프레임워크가, 상호작용 기록이 없는 신규 아이템에 대한 개인화된 추천 성능을 향상시킬 수 있는가?
  • RQ2엔드 투 엔드로 사용자 상호작용 데이터에서 훈련된 신경망 기반 텍스트 임베딩 함수가 추천에 필요한 의미적 특징을 얼마나 효과적으로 포착할 수 있는가?
  • RQ3비지도 사전 훈련된 임베딩과 지도 학습 기반 상호작용 기반 임베딩을 융합함으로써, 냉각기 아이템에 대한 모델 성능 향상 정도는 어느 정도인가?
  • RQ4제안된 조합 모듈이 임베딩을 단순히 연결하거나 평균화하는 것보다 의미적 및 사용자 기반 선호도를 더 효과적으로 포착할 수 있는가?
  • RQ5실제 데이터셋에서 기존 최고 수준의 방법들과 비교할 때, 모델의 순위 정확도와 일반화 능력은 어떻게 평가되는가?

주요 결과

  • 제안된 공동 텍스트 임베딩 모델은 두 개의 실제 데이터셋에서 새로 등장한 콘텐츠 추천에 대해 최고 수준의 성능을 달성한다.
  • 지난 학습된 지도 학습 텍스트 임베딩과 비지도 학습 텍스트 임베딩의 융합은 특히 냉각기 아이템에 대해 추천 효과성 향상에 크게 기여한다.
  • 모델은 단어의 다양한 의미를 정확히 구분한다 — 예를 들어, 지도 학습 모델에서는 'neural'이 인공 신경망과 관련이 있고, 사용자 행동 맥락에서는 신경과학과 관련이 있다.
  • 검색 결과에서 볼 수 있듯이, 비지도 임베딩만 사용하는 것보다 이 프레임워크는 더 관련성 있고 의미적으로 일관된 유사 기사들을 생성한다.
  • 조합 모듈은 다양한 임베딩 소스를 효과적으로 융합하여, 기준 모델 대비 더 나은 일반화 능력과 향상된 순위 매기기 성능을 달성한다.
  • 실험 결과는 상호작용 감독 신호를 사용한 엔드 투 엔드 훈련이 고립된 사전 훈련된 임베딩을 사용하는 것보다 더 작업에 적합한 텍스트 표현을 도출함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.