Skip to main content
QUICK REVIEW

[논문 리뷰] ResAct: Reinforcing Long-term Engagement in Sequential Recommendation with Residual Actor

Wanqi Xue, Qingpeng Cai|arXiv (Cornell University)|2022. 06. 01.
Recommender Systems and Techniques인용 수 6
한 줄 요약

ResAct는 비용이 많이 드는 온라인 상호작용을 피하기 위해 배포 중인 온라인 정책에 가까운, 그러나 더 나은 정책을 학습하는 강화학습 프레임워크를 제안한다. 장기적인 참여도를 향상시키기 위해 잔차 액터를 사용해 행동 재구성과 정보 이론적 정규화를 통해 특징 표현력과 간결성을 향상시킨다. 이는 벤치마크 및 산업 데이터셋에서 최신 기술(SOTA)을 초월하는 성능을 달성한다.

ABSTRACT

Long-term engagement is preferred over immediate engagement in sequential recommendation as it directly affects product operational metrics such as daily active users (DAUs) and dwell time. Meanwhile, reinforcement learning (RL) is widely regarded as a promising framework for optimizing long-term engagement in sequential recommendation. However, due to expensive online interactions, it is very difficult for RL algorithms to perform state-action value estimation, exploration and feature extraction when optimizing long-term engagement. In this paper, we propose ResAct which seeks a policy that is close to, but better than, the online-serving policy. In this way, we can collect sufficient data near the learned policy so that state-action values can be properly estimated, and there is no need to perform online exploration. ResAct optimizes the policy by first reconstructing the online behaviors and then improving it via a Residual Actor. To extract long-term information, ResAct utilizes two information-theoretical regularizers to confirm the expressiveness and conciseness of features. We conduct experiments on a benchmark dataset and a large-scale industrial dataset which consists of tens of millions of recommendation requests. Experimental results show that our method significantly outperforms the state-of-the-art baselines in various long-term engagement optimization tasks.

연구 동기 및 목표

  • 장기적인 사용자 참여도를 최적화하는 데 있어 순차적 추천에서의 도전 과제를 해결하기 위해, DAU 및 체류 시간과 같은 지표에 매우 중요하다.
  • 강화학습의 실제 시스템 적용에서의 한계를 극복하기 위해, 희박한 보상, 높은 탐색 비용, 장기적 책임 할당 문제를 해결한다.
  • 현재 온라인 서비스 정책에 가까이 있으면서도 그보다 나은 정책을 온라인 상호작용 없이 학습한다.
  • 정보 이론적 정규화를 통해 표현력과 간결성을 확보함으로써 장기적인 참여도를 위한 특징 표현을 향상시킨다.
  • 제안된 방법의 유효성을 벤치마크 및 대규모 산업 데이터셋에서 검증한다.

제안 방법

  • ResAct는 이력 데이터를 사용해 온라인 서비스 정책의 행동을 재구성하여 지도 학습 전처리 단계를 구축한다.
  • 잔차 액터를 도입하여 재구성된 정책을 개선하는 방식으로, 전체 온라인 상호작용 없이 국소 정책 최적화를 가능하게 한다.
  • 두 가지 정보 이론적 정규화 기법을 사용한다: 하나는 은닉 상태와 사용자 이력 간 상호정보량을 최대화하여 표현력 향상(표현력), 다른 하나는 표현 간 부재를 최소화하여 간결성 확보(간결성).
  • 복잡한 정책 최적화 과정을 행동 재구성과 잔차 정책 개선이라는 두 가지 하위 과제로 분해함으로써 학습을 단순화한다.
  • 재구성된 데이터를 사용해 지도 학습 방식으로 종단 간(end-to-end) 학습을 수행함으로써 온라인 탐색과 보상의 희박성 문제를 피한다.
  • 모델은 MovieLens-1m와 수천만 건의 요청을 포함한 대규모 산업 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1온라인 상호작용 없이 현재 온라인 서비스 정책에 가까운, 그러나 더 나은 정책을 학습할 수 있는가?
  • RQ2보상이 희박하고 지연될 경우 장기적인 참여도는 어떻게 최적화할 수 있는가?
  • RQ3특징 표현력과 간결성이 장기적 추천 성능 향상에 어떤 역할을 하는가?
  • RQ4정보 이론적 정규화 기법이 순차적 추천의 표현 학습을 효과적으로 향상시킬 수 있는가?
  • RQ5잔차 액터 메커니즘이 장기적 참여도 과제에서 직접 정책 학습보다 우수한 성능을 내는가?

주요 결과

  • ResAct는 장기적 참여도 최적화 과제에서 MovieLens-1m 벤치마크와 대규모 산업 데이터셋인 RecL-25m에서 최신 기술(SOTA) 기반선을 크게 능가한다.
  • RecL-25m 데이터셋에서 ResAct는 세션 길이에 대해 7.3%의 상대적 향상과 환수 시간에 대해 12.1%의 향상을 기록하여 가장 강력한 기반선을 초월한다.
  • 제거 실험 결과, 표현력 또는 간결성 정규화 기법을 제거할 경우 성능 저하가 심각하게 발생함을 확인하여, 이들이 핵심적인 역할을 한다는 것을 입증한다.
  • 두 정규화 기법을 모두 제거할 경우 한 가지만 제거했을 때보다 성능 저하가 덜 발생함을 통해 표현력과 간결성 간 상호보완적 효과가 있음을 시사한다.
  • 잔차 액터 메커니즘이 전체 정책 공간에서의 정책 최적화보다 효과적인 국소 정책 개선을 가능하게 하여 더 나은 성능을 달성한다.
  • 온라인 상호작용 없이도 뛰어난 성능을 달성함으로써 산업적 도입에 실용적임을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.