Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Reinforcement Learning for Online Advertising in Recommender Systems

Xiangyu Zhao, Changsheng Gu|arXiv (Cornell University)|2019. 09. 09.
Reinforcement Learning in Robotics참고 문헌 46인용 수 12
한 줄 요약

이 논문은 광고 수익과 사용자 경험의 균형을 맞추기 위해 추천 목록에서 광고 삽입 결정, 광고 선택, 배치 위치를 종합적으로 최적화하는 딥 강화학습 프레임워크를 제안한다. 맞춤형 딥 Q-네트워크를 사용하여 모델은 장기 보상을 동적으로 최대화하며, 실제 데이터에서 뛰어난 성능을 입증한다.

ABSTRACT

With the recent prevalence of Reinforcement Learning (RL), there have been tremendous interests in utilizing RL for online advertising in recommendation platforms (e.g. e-commerce and news feed sites). However, most RL-based advertising algorithms focus on solely optimizing the revenue of ads while ignoring possible negative influence of ads on user experience of recommended items (products, articles and videos). Developing an optimal advertising algorithm in recommendations faces immense challenges because interpolating ads improperly or too frequently may decrease user experience, while interpolating fewer ads will reduce the advertising revenue. Thus, in this paper, we propose a novel advertising strategy for the rec/ads trade-off. To be specific, we develop a reinforcement learning based framework that can continuously update its advertising strategies and maximize reward in the long run. Given a recommendation list, we design a novel Deep Q-network architecture that can determine three internally related tasks jointly, i.e., (i) whether to interpolate an ad or not in the recommendation list, and if yes, (ii) the optimal ad and (iii) the optimal location to interpolate. The experimental results based on real-world data demonstrate the effectiveness of the proposed framework.

연구 동기 및 목표

  • 추천 시스템에서 광고 수익과 사용자 경험 간의 상충 관계를 해결하기 위해.
  • 사용자 상호작용에 실시간으로 적응하는 동적 광고 전략을 개발하기 위해.
  • 광고 삽입 결정, 광고 선택, 배치 위치의 세 가지 상호의존적 작업을 종합적으로 최적화하기 위해.
  • 단기 광고 수익과 장기 사용자 만족도의 균형을 통해 장기 보상을 최대화하기 위해.
  • 추천 플랫폼의 실제 데이터를 사용하여 프레임워크를 검증하기 위해.

제안 방법

  • 광고 삽입, 선택, 배치의 종합 최적화를 처리할 수 있도록 설계된 새로운 딥 Q-네트워크(DQN) 아키텍처가 개발되었다.
  • DQN 에이전트는 현재의 추천 목록을 관찰하고, 광고를 삽입할지 여부, 어떤 광고를 선택할지, 어디에 배치할지 결정하기 위한 동작을 수행한다.
  • 에이전트의 행동 공간은 목록 내 모든 가능한 광고 삽입 결정, 광고 선택, 배치 위치 조합을 포함한다.
  • 보상 함수는 즉각적인 광고 수익과 장기적 사용자 참여도를 반영하도록 설계되어, 수익과 사용자 경험 간의 상충 관계를 반영한다.
  • 프레임워크는 사용자 피드백과 상호작용 결과에 기반해 정책을 지속적으로 업데이트하기 위해 딥 Q-학습을 사용한다.
  • 모델은 실제 데이터를 기반으로 엔드 투 엔드로 훈련되어 시간이 지남에 따라 최적의 광고 전략을 학습한다.

실험 결과

연구 질문

  • RQ1강화학습 프레임워크는 어떻게 추천 시스템에서 광고 수익과 사용자 경험을 효과적으로 균형 잡을 수 있는가?
  • RQ2광고 삽입, 선택, 배치를 종합적으로 최적화함으로써 장기적 시스템 성능에 어떤 영향을 미치는가?
  • RQ3DQN 기반 에이전트는 히우리스틱 또는 고정 전략보다 더 나은 광고 결정을 학습할 수 있는가?
  • RQ4복잡한 사용자 행동과 동적 콘텐츠를 가진 실제 환경에서 모델의 성능은 어떠한가?
  • RQ5각 구성 요소(삽입, 선택, 배치)가 총 보상에 기여하는 비율은 어떻게 되는가?

주요 결과

  • 제안된 DRL 프레임워크는 수익 최적화에만 집중하는 기준 기반 방법에 비해 장기 보상을 크게 향상시킨다.
  • 삽입, 선택, 배치의 종합 최적화는 더 나은 사용자 경험과 높은 지속적 참여도를 이끌어낸다.
  • 모델은 광고 과다 삽입을 피함으로써 사용자 만족도에 부정적 영향을 줄이면서도 높은 수익을 유지하는 법을 학습한다.
  • 프레임워크는 다양한 실제 추천 시나리오에서 뛰어난 성능을 보이며 강건성을 입증한다.
  • DQN 기반 접근법은 광고 수익 및 사용자 유지를 위한 지표에서 측정 가능한 성과 향상을 달성한다.
  • 제거 실험 결과, 삽입, 선택, 배치의 세 구성 요소가 모두 총 성능 향상에 의미 있는 기여를 한다는 것이 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.