Skip to main content
QUICK REVIEW

[논문 리뷰] Constrained Reinforcement Learning for Short Video Recommendation

Qingpeng Cai, Ruohan Zhan|arXiv (Cornell University)|2022. 05. 26.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 짧은 영상 추천에서 장기적 시청 시간을 최적화하면서도 보조 사용자 상호작용(예: 공유, 다운로드) 성능을 유지하는 이단계 제약 강화학습 프레임워크를 제안한다. 먼저 보조 반응에 대해 정책을 사전 학습한 후, 이러한 정책 주변에 머무르도록 제약을 두어 주 정책을 학습시키는 방식으로, 시청 시간과 상호작용 지표 간의 균형을 뛰어나게 향상시킨다. 실시간 실험에서 이 방법은 지도 학습 기반 보조 정책 대비 +0.336%의 시청 시간 향상과 +3.324%의 공유 증가를 기록하여 베이스라인을 초월한다.

ABSTRACT

The wide popularity of short videos on social media poses new opportunities and challenges to optimize recommender systems on the video-sharing platforms. Users provide complex and multi-faceted responses towards recommendations, including watch time and various types of interactions with videos. As a result, established recommendation algorithms that concern a single objective are not adequate to meet this new demand of optimizing comprehensive user experiences. In this paper, we formulate the problem of short video recommendation as a constrained Markov Decision Process (MDP), where platforms want to optimize the main goal of user watch time in long term, with the constraint of accommodating the auxiliary responses of user interactions such as sharing/downloading videos. To solve the constrained MDP, we propose a two-stage reinforcement learning approach based on actor-critic framework. At stage one, we learn individual policies to optimize each auxiliary response. At stage two, we learn a policy to (i) optimize the main response and (ii) stay close to policies learned at the first stage, which effectively guarantees the performance of this main policy on the auxiliaries. Through extensive simulations, we demonstrate effectiveness of our approach over alternatives in both optimizing the main goal as well as balancing the others. We further show the advantage of our approach in live experiments of short video recommendations, where it significantly outperforms other baselines in terms of watch time and interactions from video views. Our approach has been fully launched in the production system to optimize user experiences on the platform.

연구 동기 및 목표

  • 짧은 영상 추천에서 밀도 높은 시청 시간과 희박한 상호작용 신호를 동시에 최적화하는 문제를 해결하기 위해.
  • 장기적 시청 시간을 우선시하면서도 공유, 다운로드와 같은 보조 반응이 간과되지 않도록 보장하는 강화학습 프레임워크를 개발하기 위해.
  • 단일 목표 강화학습과 가중치 합 보상 접근 방식이 서로 다른 반응 빈도와 할인율을 처리하지 못하는 한계를 극복하기 위해.
  • 실제 생산 환경의 추천 시스템에 적용 가능한 실용적이고 확장 가능한 방법을 설계하기 위해.

제안 방법

  • 시청 시간을 주 목표로 하고 상호작용 신호를 제약으로 삼는 제약 마르코프 결정 과정(CMDP)으로 짧은 영상 추천을 공식화한다.
  • 이중 단계 학습 프로세스를 적용한다: 먼저 각 보조 반응(예: 공유, 다운로드)을 별도로 최적화하기 위해 개별 A3C 정책을 학습시킨다.
  • 반응 유형에 특화된 가치 네트워크와 개별 할인 요소를 사용하여 희박한 신호와 밀도 높은 신호를 정확히 평가함으로써, 서로 다른 반응 유형 간 간섭을 방지한다.
  • 두 번째 단계에서는 누적 시청 시간을 최대화하면서도 보조 정책 주변에 머무르도록 제약을 두어 주 정책을 학습시킨다.
  • 액터 업데이트에 이웃성 정규화 항을 소프트 제약으로 적용하여 주 정책이 보조 정책에서 너무 멀리 벗어나지 않도록 보장한다.
  • 여러 반응 유형별 크리틱의 가치 추정을 통합하여 주 정책의 학습을 이끄는 크리틱 업데이트 규칙을 적용한다.

실험 결과

연구 질문

  • RQ1제약 강화학습 프레임워크는 짧은 영상 추천에서 장기적 시청 시간과 다수의 보조 사용자 상호작용 신호를 효과적으로 균형 있게 조율할 수 있는가?
  • RQ2반응 유형에 맞는 가치 네트워크와 개별 할인 요소는 반응 빈도와 시간적 구조가 다른 상황에서 정책 학습을 어떻게 향상시키는가?
  • RQ3보조 정책을 사전 학습하고 주 정책를 그 주변에 머물게 제약하는 방식이 공동 최적화보다 주 정책 및 보조 정책 목표 모두에서 더 높은 성능을 내는가?
  • RQ4이중 단계 접근 방식은 실시간 배포 환경에서 표준 A3C와 RCPO에 비해 어느 정도 뛰어난 성능을 보이는가?
  • RQ5밀도 높은 시청 시간 최적화를 하면서도 희박한 상호작용 신호(예: 공유, 다운로드)에 대해 강력한 성능을 유지할 수 있는가?

주요 결과

  • 제안된 이단계 제약 A3C 방법은 실시간 실험에서 지도 학습 기반 LTR 기반 보조 정책 대비 +0.336%의 시청 시간 향상과 +3.324%의 공유 증가를 달성했다.
  • 모델는 A3C와 RCPO-A3C를 크게 앞서며 보조 지표 균형을 뛰어나게 향상시켰으며, 공유 3.324% 증가, 다운로드 1.785% 증가를 기록했고, 시청 시간 성과도 유지했다.
  • 학습 곡선은 주 정책이 상호작용 최적화 정책 주변에 머물며 빠르게 공유 성능을 향상시킨다는 점에서 효과적인 제약 강화가 이루어졌음을 보여주었다.
  • 각 반응 유형별 별도의 가치 네트워크 도입으로 희박한 신호의 경우에도 할인 요소를 별도로 설정함으로써 학습 안정성과 정확도가 향상되었고, 신호 간 간섭이 감소했다.
  • 간단한 조합 방법 대비 시청 시간 추정에서 0.191% 향상, 상호작용 신호 추정에서 0.143% 향상된 결과를 통해 설계 선택의 타당성을 입증했다.
  • 이 방법은 쿠아이슈우(Kuaishou)에서 완전히 생산 환경에 도입되어 실제 적용에서의 확장성과 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.