Skip to main content
QUICK REVIEW

[논문 리뷰] Reinforcement Learning to Optimize Long-term User Engagement in Recommender Systems

Lixin Zou, Long Xia|arXiv (Cornell University)|2019. 02. 13.
Recommender Systems and Techniques참고 문헌 38인용 수 21
한 줄 요약

이 논문은 피드 기반 추천 시스템에서 장기적 사용자 참여도를 최적화하기 위해 계층적 LSTM 기반 Q-네트워크로 복잡한 사용자 행동을 모델링하고, 환경을 시뮬레이션하여 오프-폴리시 학습을 안정화하는 S-네트워크를 결합한 강화학습 프레임워크인 FeedRec을 제안한다. FeedRec은 통계적으로 유의미한 향상( p < 0.01)을 보이며, 체류 시간, 재방문 빈도, 누적 클릭 수를 포함한 장기적 참여도 지표에서 최신 기술들을 뛰어넘는 성능을 보인다.

ABSTRACT

Recommender systems play a crucial role in our daily lives. Feed streaming mechanism has been widely used in the recommender system, especially on the mobile Apps. The feed streaming setting provides users the interactive manner of recommendation in never-ending feeds. In such an interactive manner, a good recommender system should pay more attention to user stickiness, which is far beyond classical instant metrics, and typically measured by {\bf long-term user engagement}. Directly optimizing the long-term user engagement is a non-trivial problem, as the learning target is usually not available for conventional supervised learning methods. Though reinforcement learning~(RL) naturally fits the problem of maximizing the long term rewards, applying RL to optimize long-term user engagement is still facing challenges: user behaviors are versatile and difficult to model, which typically consists of both instant feedback~(e.g. clicks, ordering) and delayed feedback~(e.g. dwell time, revisit); in addition, performing effective off-policy learning is still immature, especially when combining bootstrapping and function approximation. To address these issues, in this work, we introduce a reinforcement learning framework --- FeedRec to optimize the long-term user engagement. FeedRec includes two components: 1)~a Q-Network which designed in hierarchical LSTM takes charge of modeling complex user behaviors, and 2)~an S-Network, which simulates the environment, assists the Q-Network and voids the instability of convergence in policy learning. Extensive experiments on synthetic data and a real-world large scale data show that FeedRec effectively optimizes the long-term user engagement and outperforms state-of-the-arts.

연구 동기 및 목표

  • 클릭 수와 같은 즉각적인 지표를 넘어서 장기적 사용자 참여도를 최적화하는 데 도전하는 피드 스트리밍 추천 시스템의 문제를 해결한다.
  • 함수 근사, 부트스트랩핑, 오프라인 학습이 결합된 '치명적 삼총구'(Deadly Triad)로 인해 발생하는 오프-폴리시 딥 강화학습의 불안정성 및 발산 문제를 극복한다.
  • 다양한 사용자 행동, 즉 즉각적인(예: 클릭) 및 지연된 피드백(예: 체류 시간, 재방문)을 모델링할 수 있는 확장 가능하고 안정적인 RL 프레임워크를 개발한다.
  • 비용이 많이 드는 온라인 탐색이 필요 없이 기록된 상호작용 데이터를 사용하여 효과적인 오프라인 정책 학습을 가능하게 한다.
  • 사용자 참여도와 추천 다양성 간의 관계를 조사하여, 직접적인 참여도 최적화가 다양성 향상에 기여하는지 테스트한다.

제안 방법

  • 클릭 수, 체류 시간, 브라우징 깊이, 재방문 빈도를 조합한 다성분 보상 함수를 포함하는 마르코프 결정 과정(MDP)으로 피드 스트리밍 추천을 수식화한다.
  • 다양한 상호작용 수준(예: 아이템 수준 및 세션 수준의 동적 행동)에서 복잡한 순차적 사용자 행동을 모델링하기 위해 계층적 LSTM 기반 Q-네트워크를 설계한다.
  • 기록된 데이터로부터 환경 동역학을 예측하는 데 목적이 있는 S-네트워크(S-Network, 시뮬레이터 네트워크)를 도입하여, 부트스트랩핑 오차를 줄임으로써 오프-폴리시 학습을 안정화한다.
  • S-네트워크를 사용하여 Q-네트워크 학습을 위한 합성 전이 데이터를 생성함으로써 실제 환경과의 직접 상호작용을 피하고, 치명적 삼총구 문제를 완화한다.
  • 경험 재생을 사용한 오프-폴리시 딥 Q-학습을 적용하며, 재생 버퍼는 실제 기록된 데이터와 S-네트워크에서 생성된 합성 전이 데이터를 모두 포함한다.
  • 다양한 참여도 지표의 중요도를 균형 잡기 위해 가중치(ω)를 학습 가능한 것으로 설정하여, 단기 목표와 장기 목표 간의 트레이드오프 분석을 가능하게 한다.

실험 결과

연구 질문

  • RQ1딥 강화학습 프레임워크는 전통적인 클릭률 지표를 넘어서 피드 기반 추천 시스템에서 장기적 사용자 참여도를 효과적으로 최적화할 수 있는가?
  • RQ2함수 근사와 부트스트랩핑이 결합된 오프-폴리시 학습에서 발생하는 불안정성 문제인 '치명적 삼총구' 문제는 실세계 추천 시스템에서 어떻게 완화될 수 있는가?
  • RQ3장기적 참여도를 직접 최적화함으로써 추천 다양성이 어느 정도 향상되는가? 그리고 다양성은 사용자 만족도 향상의 부산물인가?
  • RQ4보상 함수에서 다양한 참여도 지표의 가중치 설정에 따라 제안된 프레임워크의 성능는 얼마나 민감하게 변하는가?
  • RQ5오프라인 데이터에서 학습된 정책은 온라인 최적화나 표준 DQN 기반 방법에 비해 안정적이고 뛰어난 성능을 달성할 수 있는가?

주요 결과

  • FeedRec은 실제 전자상거래 데이터에서 모든 최신 기술 기반 베이스라인보다 뚜렷이 뛰어나며, 누적 클릭 수에서 12.7% 향상( p < 0.01)과 재방문 빈도에서 15.3% 증가( p < 0.01)를 기록했다.
  • S-네트워크는 학습을 안정화시키며, 성능 저하를 방지한다. DQN과 DDPG-KNN는 조기에 정점에 도달한 후 붕괴되는 반면, FeedRec는 모든 학습 반복 과정에서 높은 성능을 유지한다.
  • 누적 클릭 수 최적화는 깊이 및 재방문 시간 지표에 대해 ω = 0.005일 때 달성되며, 이는 지연된 지표에 중간 수준의 가중치를 부여함으로써 클릭률을 희생시키지 않고도 총 참여도를 향상시킬 수 있음을 시사한다.
  • FeedRec는 더 다양한 아이템 추천을 선호하는 정책을 학습한다. 행동 공간에서의 높은 다양성 점수로 이를 입증하며, 직접적인 참여도 최적화가 자연스럽게 추천 다양성을 향상시킨다는 것을 시사한다.
  • 합성 데이터에서도 프레임워크는 뛰어난 강건성과 일반화 능력을 보이며, 복잡한 사용자 행동 시퀀스와 장기적 의존성을 효과적으로 모델링할 수 있음을 확인했다.
  • 유의미성 검정을 통해 모든 성능 향상이 기준선 대비 통계적으로 유의미하다(p < 0.01)는 점을 확인하여, 제안된 아키텍처와 학습 전략의 효과성을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.