[논문 리뷰] Top-K Off-Policy Correction for a REINFORCE Recommender System
이 논문은 REINFORCE를 사용하여 대규모 산업용 추천 시스템에서 안정적이고 확장 가능한 정책 그래เดียน트 학습을 가능하게 하기 위해 새로운 top-K 오프-정책 보정 방법을 제안한다. 로그된 피드백을 통해 다수의 행동 정책에서 발생하는 데이터 편향을 보정하고, 다중 항목 추천을 고려함으로써 장기적인 사용자 참여도를 향상시켰으며, 실시간 유튜브 실험에서 ViewTime은 0.85% 증가하고, 시청한 영상 수는 0.53% 증가하였다.
Industrial recommender systems deal with extremely large action spaces -- many millions of items to recommend. Moreover, they need to serve billions of users, who are unique at any point in time, making a complex user state space. Luckily, huge quantities of logged implicit feedback (e.g., user clicks, dwell time) are available for learning. Learning from the logged feedback is however subject to biases caused by only observing feedback on recommendations selected by the previous versions of the recommender. In this work, we present a general recipe of addressing such biases in a production top-K recommender system at Youtube, built with a policy-gradient-based algorithm, i.e. REINFORCE. The contributions of the paper are: (1) scaling REINFORCE to a production recommender system with an action space on the orders of millions; (2) applying off-policy correction to address data biases in learning from logged feedback collected from multiple behavior policies; (3) proposing a novel top-K off-policy correction to account for our policy recommending multiple items at a time; (4) showcasing the value of exploration. We demonstrate the efficacy of our approaches through a series of simulations and multiple live experiments on Youtube.
연구 동기 및 목표
- 다양한 과거 정책에서 기록된 피드백으로 인한 데이터 편향을 해결하기 위해, 비정적 행동 패턴을 가진 다수의 정책에서 기록된 데이터의 편향을 다루는 것.
- 실제 생산 환경에서 수백만 개의 항목을 포함하는 행동 공간을 다룰 수 있도록 REINFORCE 정책 그래디언트 알고리즘을 확장하는 것.
- 동시에 다수의 항목을 추천하는 상황을 고려하여 특화된 새로운 top-K 오프-정책 보정 메커니즘을 개발하는 것.
- 탐색 및 분산 감소 기법이 장기적인 사용자 만족도와 참여도 향상에 미치는 영향을 입증하는 것.
- 시뮬레이션과 대규모 실시간 실험을 통해 방법의 타당성을 검증하는 것.
제안 방법
- 심층 신경망을 통한 함수 근사 기법을 사용하여 행동 공간이 수백만 개에 이르는 대규모 항목을 다루는 신경 기반 후보 생성기와 함께 REINFORCE 알고리즘을 적용한다.
- 로그 정책을 모델링하고 중요도 샘플링을 사용하여 로그된 피드백을 재가중함으로써 오프-정책 보정을 적용하여 비균일한 데이터 수집으로 인한 편향을 감소시킨다.
- 기존의 top-1 추천 중심 방식에서 벗어나, K개 항목을 동시에 추천하는 상황을 고려한 새로운 top-K 오프-정책 보정 기법을 도입하여, 상위 1개 초과의 관련 항목에 대해 비영이 아닌 확률 질량을 확보한다.
- 중요도 가중치의 최대값 설정(c = e³)을 통해 분산 감소 기법을 구현하여, 고수익·저확률 행동에 대한 과적합을 방지한다.
- 학습된 로그 정책을 사용하여 행동 정책를 추정함으로써, 로그된 암묵적 피드백에서 발생하는 선택 편향을 정확하게 보정할 수 있도록 한다.
- TRPO 스타일 제약 조건과 정규화된 중요도 샘플링을 적용하여 학습의 안정성과 수렴 성능을 추가로 향상시킨다.
실험 결과
연구 질문
- RQ1행동 공간이 수백만 개에 이르는 실전 추천 시스템에 REINFORCE 알고리즘을 어떻게 확장할 수 있는가?
- RQ2기본적인 오프-정책 보정 기법이 top-K 추천 환경에서는 어느 정도 실패하며, 이를 어떻게 개선할 수 있는가?
- RQ3top-K 오프-정책 보정이 ViewTime 및 영상 시청 수와 같은 사용자 참여도 지표에 미치는 영향은 어떠한가?
- RQ4K와 중요도 가중치 최대값 설정(c)과 같은 하이퍼파라미터가 학습된 정책의 성능과 안정성에 미치는 영향은 어떠한가?
- RQ5오프-정책 보정을 통한 탐색이 장기적인 사용자 만족도 향상에 측정 가능한 영향을 미치는가?
주요 결과
- 실시간 유튜브 실험에서 top-K 오프-정책 보정으로 인해 ViewTime은 통계적으로 유의미하게 0.85% 증가하고, 시청한 영상 수는 0.53% 증가하였다.
- top-K 보정에서 K=1을 사용할 경우 기준 K=16 대비 ViewTime이 0.66% 감소하여, top-1 중심 학습보다 다중 항목 보정 방식이 유의미한 이점을 가짐을 확인하였다.
- K=8로 설정했을 경우 ViewTime이 통계적으로 유의미하게 +0.15% 향상되어, 탐색과 이용 간의 최적 균형을 이루는 것으로 나타났다.
- 중요도 가중치 최대값을 c=e³에서 c=e⁵로 상향 조정했을 경우 ViewTime이 0.52% 감소하여, 최대값 설정이 고분산·저확률 행동에 대한 과적합을 방지함을 입증하였다.
- 기본 오프-정책 보정은 상위 1개 정확도에 집중한 정책을 초래하는 반면, top-K 보정은 보다 매끄럽고 전체적인 top-K 추천 품질이 향상된 정책을 생성하였다.
- 시뮬레이션과 실시간 실험을 통해 K개 항목의 동시 추천을 고려한 방법이 상위 1개 중심 기법보다 전체 화면 사용자 경험을 크게 향상시킴을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.