Skip to main content
QUICK REVIEW

[논문 리뷰] Generative Adversarial User Model for Reinforcement Learning Based Recommendation System

Xinshi Chen, Shuang Li|arXiv (Cornell University)|2018. 12. 27.
Advanced Bandit Algorithms Research참고 문헌 28인용 수 62
한 줄 요약

이 논문은 생성적 적대적 사용자 모델을 활용하여 사용자 행동 역학과 보상을 학습하는 모델 기반 RL 프레임워크를 제안하고, 조합 아이템 추천을 효율적으로 수행하기 위해 cascading DQN을 도입한다.

ABSTRACT

There are great interests as well as many challenges in applying reinforcement learning (RL) to recommendation systems. In this setting, an online user is the environment; neither the reward function nor the environment dynamics are clearly defined, making the application of RL challenging. In this paper, we propose a novel model-based reinforcement learning framework for recommendation systems, where we develop a generative adversarial network to imitate user behavior dynamics and learn her reward function. Using this user model as the simulation environment, we develop a novel Cascading DQN algorithm to obtain a combinatorial recommendation policy which can handle a large number of candidate items efficiently. In our experiments with real data, we show this generative adversarial user model can better explain user behavior than alternatives, and the RL policy based on this model can lead to a better long-term reward for the user and higher click rate for the system.

연구 동기 및 목표

  • 환경이 미지수하고 보상이 암시적일 때 추천에서 장기적인 사용자 참여를 위한 강화학습의 동기를 부여한다.
  • 동시에 사용자 행동 모델과 보상 함수를 모두 학습하는 통합된 모델 기반 RL 프레임워크를 제안한다.
  • 사용자 역학과 보상을 공동으로 추정하기 위한 생성적 적대적 학습 절차를 개발한다.
  • 대규모 후보 풀에서 상위 k 개 아이템을 효율적으로 선택하기 위한 cascading DQN 정책을 도입한다.

제안 방법

  • 사용자가 보상을 최대화하는 순차적 의사결정 프로세스로서 사용자가 자신의 보상을 최대화하기 위해 아이템을 선택하는 환경을 형식화하고, 히스토리 의존적 보상을 둔다.
  • 과거에 클릭한 아이템의 임베딩으로 사용자의 상태를 매개화하고, 학습된 신경망 구성 요소를 사용하여 보상 함수 r(s,a)를 정의한다.
  • 생성적 적대적 학습(GAN 유사 구조)으로 행동 모델 φ와 보상 r를 미니맥스 설정으로 동시 최적화한다.
  • φ와 r를 학습할 때 안정적 초기화와 학습을 위한 엔트로피 정규화 하에서 닫힌 형식 해를 제공한다.
  • 대규모 조합 공간을 효율적으로 최적화하기 위해 max over subsets를 연쇄된 작은 Q-함수들의 cascade로 분해하는 Cascading Q-Networks(및 관련 손실)를 개발한다.
  • GAN 사용자 모델로 구축된 시뮬레이션 환경을 사용해 정책을 학습하고 평가하여 장기 보상과 클릭률을 예측한다.

실험 결과

연구 질문

  • RQ1GAN 기반 사용자 모델이 baselines보다 사용자 행동과 보상을 더 잘 예측할 수 있는가?
  • RQ2모델 기반 RL 정책이 모델 프리 또는 탐욕적 baselines와 비교해 장기 보상과 시스템 CTR을 향상시키는가?
  • RQ3추천 설정에서 큰 조합 액션 공간에 대해 Cascading Q-network 접근법이 어떻게 성능을 보이는가?
  • RQ4학습된 사용자 모델이 새로운 역학이나 제한된 상호작용에 빠르게 적응할 수 있는가?

주요 결과

  • GAN-PW와 GAN-LSTM은 여러 실제 데이터 세트에서 baselines보다 예측 정확도가 우수하며, GAN-PW가 효율성-정확도 균형을 우호적으로 제공한다.
  • GAN 기반 접근법은 추천 아이템의 누적 보상과 CTR을 여러 강력한 baselines(W&D-LR, W&D-CCF, GAN-Greedy, GAN-RWD1, GAN-GDQN, GAN-CDQN 등)보다 높게 나타냈다.
  • GAN-CDQN은 대안 RL 정책을 꾸준히 능가하며 보고된 표에서 가장 높은 보상과 CTR를 달성한다(예: k=3 및 k=5의 경우).
  • cascading Q-network 프레임워크는 상위 k개 아이템을 선택하기 위해 O(k|I|) 계산을 가능하게 하여 대규모 후보 풀에 대한 조합 추천을 확장 가능하게 한다.
  • GAN 기반 모델은 새로운 dynamics에 대한 적응 속도가 모델 프리 방식보다 빠르며, 학습된 환경 모델을 활용한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.