Skip to main content
QUICK REVIEW

[논문 리뷰] Diversity-Promoting Deep Reinforcement Learning for Interactive Recommendation

Yong Liu, Yinan Zhang|arXiv (Cornell University)|2019. 03. 19.
Tensor decomposition and applications인용 수 14
한 줄 요약

이 논문은 개인화된 결정성 점진적 프로세스(DPP)를 액터-크리틱 강화학습 아키텍처와 통합한 다양성 촉진 딥 강화학습 프레임워크인 D²RL을 제안한다. 깊이 강화학습을 통해 동적으로 항목 관련성을 학습하고 고정된 항목 유사도 행렬과 조합함으로써 D²RL은 다양하고 관련성이 높은 추천을 생성하며, Movielens 데이터셋에서 오프라인 및 시뮬레이티드 온라인 실험 모두에서 정확도와 다양성 측면에서 최신 기술을 능가한다.

ABSTRACT

Interactive recommendation that models the explicit interactions between users and the recommender system has attracted a lot of research attentions in recent years. Most previous interactive recommendation systems only focus on optimizing recommendation accuracy while overlooking other important aspects of recommendation quality, such as the diversity of recommendation results. In this paper, we propose a novel recommendation model, named \underline{D}iversity-promoting \underline{D}eep \underline{R}einforcement \underline{L}earning (D$^2$RL), which encourages the diversity of recommendation results in interaction recommendations. More specifically, we adopt a Determinantal Point Process (DPP) model to generate diverse, while relevant item recommendations. A personalized DPP kernel matrix is maintained for each user, which is constructed from two parts: a fixed similarity matrix capturing item-item similarity, and the relevance of items dynamically learnt through an actor-critic reinforcement learning framework. We performed extensive offline experiments as well as simulated online experiments with real world datasets to demonstrate the effectiveness of the proposed model.

연구 동기 및 목표

  • 기존의 상호작용 추천 시스템이 정확도에 주로 초점을 맞추며 다양성 부족 문제를 해결하지 못하는 데 대응하기 위해.
  • 동적인 사용자 선호도 모델링을 통해 다양하면서도 관련성이 높은 추천을 촉진하는 강화학습 기반 프레임워크를 개발하기 위해.
  • 온라인 평가를 위해 관련성과 다양성 선호도를 모두 반영한 실제 사용자 피드백을 시뮬레이션하기 위해.
  • 제안된 모델이 오프라인 및 온라인 상호작용 추천 환경 모두에서 효과적인지를 입증하기 위해.

제안 방법

  • D²RL 프레임워크는 개인화된 DPP 커널 행렬을 사용하여 각 사용자에게 다양하고 관련성이 높은 항목 추천을 생성한다.
  • DPP 커널은 고정된 항목-항목 유사도 행렬과 딥 강화학습을 통해 동적으로 학습된 관련성 행렬로 구성된다.
  • 액터-크리틱 딥 강화학습 프레임워크를 활용한다: 액터는 행동 벡터(즉, DPP 커널 파라미터)를 생성하고, 크리틱은 즉각적 보상과 미래 보상 모두를 사용하여 정책 품질을 평가한다.
  • DPP 모델은 결정성 점진적 프로세스를 통해 집합 수준의 다양성을 보장하며, 높은 다양성과 관련성을 갖춘 항목 집합을 선호한다.
  • 사용자 선호도와 다양성 고려 사항을 조합하여 MMR 기반 확률 모델링을 사용하는 새로운 온라인 시뮬레이터를 도입한다.
  • 크리틱 네트워크가 추천 정책의 장기적 가치를 추정함으로써, 모델은 엔드 투 엔드로 훈련된다.

실험 결과

연구 질문

  • RQ1딥 강화학습 프레임워크는 정확도를 유지하면서도 상호작용 추천에서 다양성을 효과적으로 촉진할 수 있는가?
  • RQ2개인화된 커널을 갖춘 DPP 모델과의 통합은 표준 RL 기반 방법에 비해 추천 다양성을 얼마나 향상시키는가?
  • RQ3제안된 D²RL 모델은 온라인 피드백 시뮬레이션을 통해 동적인 사용자 선호도에 얼마나 잘 적응하는가?
  • RQ4D²RL은 오프라인 및 온라인 환경 모두에서 최신의 컨텍스트 밴딧 및 딥 강화학습 기반 상호작용 추천 방법과 비교해 어떻게 성능을 내는가?

주요 결과

  • Movielens-1M 데이터셋에서, D²RL은 오프라인 평가 전반에 걸쳐 모든 추천 에포크에서 모든 베이스라인 대비 정확도와 다양성 측면에서 일관되게 뛰어난 성능을 보였다.
  • Movielens-100K에서 시뮬레이티드 온라인 실험을 통해 D²RL은 C²UCB 대비 정밀도 52.13% 향상 및 다양성 92.79% 향상을 달성했으며, 모든 에포크에서 동일한 성능을 유지했다.
  • Movielens-1M에서 D²RL은 온라인 시뮬레이션에서 C²UCB 대비 정밀도 76.04% 향상 및 다양성 156.58% 향상하여 뛰어난 성능 안정성과 우수성을 입증했다.
  • 모델은 온라인 환경에서도 안정적이고 뛰어난 성능을 보였으며, 다양성은 초기 변동 후 금방 높은 수준을 유지하며 급격히 향상되었다.
  • Movielens-100K에서 D²RL의 다양성 성능은 베이스라인과 유사했지만, 정확도 측면에선 가끔 베이스라인에 뒤지며 크리틱 네트워크 추정에 잠재적인 불안정성이 있음을 시사했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.