Skip to main content
QUICK REVIEW

[논문 리뷰] A Text-based Deep Reinforcement Learning Framework for Interactive Recommendation

Chaoyang Wang, Zhiqiang Guo|arXiv (Cornell University)|2020. 04. 14.
Recommender Systems and Techniques참고 문헌 30인용 수 8
한 줄 요약

이 논문은 데이터 희소성 문제를 완화하고, 사용자 군집화된 액션 후보 집합에 대해 동적으로 학습된 정책 벡터를 활용하여 효율적이고 고성능의 Top-k 인터랙티브 추천을 가능하게 하는 텍스트 기반 딥 강화학습 프레임워크인 TDDPG-Rec을 제안한다. 기존의 RL 기반 방법들에 비해 훨씬 향상된 효율성으로 최신 기술 수준의 성능을 달성한다.

ABSTRACT

Due to its nature of learning from dynamic interactions and planning for long-run performance, reinforcement learning (RL) recently has received much attention in interactive recommender systems (IRSs). IRSs usually face the large discrete action space problem, which makes most of the existing RL-based recommendation methods inefficient. Moreover, data sparsity is another challenging problem that most IRSs are confronted with. While the textual information like reviews and descriptions is less sensitive to sparsity, existing RL-based recommendation methods either neglect or are not suitable for incorporating textual information. To address these two problems, in this paper, we propose a Text-based Deep Deterministic Policy Gradient framework (TDDPG-Rec) for IRSs. Specifically, we leverage textual information to map items and users into a feature space, which greatly alleviates the sparsity problem. Moreover, we design an effective method to construct an action candidate set. By the policy vector dynamically learned from TDDPG-Rec that expresses the user's preference, we can select actions from the candidate set effectively. Through experiments on three public datasets, we demonstrate that TDDPG-Rec achieves state-of-the-art performance over several baselines in a time-efficient manner.

연구 동기 및 목표

  • 인터랙티브 추천 시스템(IRS)에서 큰 이산적 액션 공간과 데이터 희소성 문제를 해결하기 위해.
  • 결정 시간 복잡도를 감소시켜 강화학습 기반 추천의 효율성을 향상시키기 위해.
  • 텍스트 정보(예: 리뷰, 설명)를 딥 강화학습에 효과적으로 통합하기 위해.
  • 정책 벡터와 액션 후보 집합을 사용하여 고성능과 시간 효율성을 동시에 확보한 Top-k 추천을 가능하게 하기 위해.

제안 방법

  • 사전 학습된 워드 벡터를 활용해 사용자와 아이템을 공통의 연속적 특징 공간에 매핑함으로써 데이터 희소성을 감소시킴.
  • 사용자의 선호 패턴을 기반으로 K-means 클러스터링을 적용하여 사용자 군집화를 수행함으로써 개인화된 후보 집합 구축을 가능하게 함.
  • 사용자 이력 및 클러스터 소속 정보를 바탕으로 협업 필터링 원칙을 적용해 양성, 부정성, 일반 아이템을 포함한 액션 후보 집합을 구성함.
  • 딥 딜레기스틱 정책 그래เดียน트(DDPG) 프레임워크를 활용하고, 특징 공간 내에서 사용자 선호도를 표현하기 위해 동적으로 학습된 정책 벡터를 적용함.
  • 정책 벡터와 아이템 벡터 간의 내적을 사용하여 후보 집합에서 상위-k 아이템을 추천하기 위해 선택함.
  • 온라인 학습의 높은 계산 비용으로 인해 오프라인 학습 및 평가를 위해 시뮬레이터를 활용함.

실험 결과

연구 질문

  • RQ1텍스트 정보가 인터랙티브 추천을 위한 딥 강화학습에 효과적으로 통합되어 데이터 희소성을 완화할 수 있는가?
  • RQ2IRS에서 큰 이산적 액션 공간을 효율적으로 관리하여 결정 속도를 향상시킬 수 있는가?
  • RQ3DDPG에서 학습된 정책 벡터가 연속적 특징 공간에서 Top-k 추천을 위한 사용자 선호도를 효과적으로 표현할 수 있는가?
  • RQ4사용자 클러스터링과 후보 집합을 조합함으로써 효율성과 추천 정확도를 동시에 향상시킬 수 있는가?

주요 결과

  • TDDPG-Rec는 HR@10과 nDCG@10 기준으로 세 개의 공개 데이터셋에서 기존의 RL 기반 기준 모델들을 능가하는 최신 기술 수준의 성능을 달성함.
  • 후보 집합과 정책 벡터를 활용함으로써 결정 시간 복잡도를 크게 감소시켜 DDPG-kNN 및 TPGR에 비해 효율성 면에서 뛰어남.
  • 특징 공간 차원 수(D)가 높아지고 클러스터 수(n_cl)가 증가할수록 성능 향상이 관찰되어 더 나은 표현 학습과 사용자 차별화가 가능함.
  • 후보 집합 크기(n_c)를 늘릴수록 샘플링의 불균형으로 인해 성능 저하가 발생하지만, 양성 아이템 비율(α)을 증가시킬수록 포화점까지 성능 향상이 관찰됨.
  • 상태 크기(n_s)의 증가는 성능에 미미한 영향을 미치지만, 액션 크기(n_a)를 늘릴수록 더 자주 상태 전이가 발생하므로 성능 향상이 관찰됨.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.