[논문 리뷰] DEAR: Deep Reinforcement Learning for Online Advertising Impression in Recommender Systems
이 논문은 장기적 수익을 극대화하면서도 사용자 경험을 유지하는 것을 목표로, 추천 목록 내 광고 삽입 결정—광고를 삽입할지 여부, 어떤 광고를 선택할지, 어디에 배치할지—를 종합적으로 최적화하는 딥 강화학습 프레임워크인 DEAR를 제안한다. 이 방법은 세 가지 결정을 동시에 처리할 수 있는 새로운 DQN 아키텍처를 사용하여 낮은 계산 부하로 높은 성능 향상을 이룬다. 실생활 단편 영상 데이터에서의 성능 향상이 뚜렷하다.
With the recent prevalence of Reinforcement Learning (RL), there have been tremendous interests in utilizing RL for online advertising in recommendation platforms (e.g., e-commerce and news feed sites). However, most RL-based advertising algorithms focus on optimizing ads' revenue while ignoring the possible negative influence of ads on user experience of recommended items (products, articles and videos). Developing an optimal advertising algorithm in recommendations faces immense challenges because interpolating ads improperly or too frequently may decrease user experience, while interpolating fewer ads will reduce the advertising revenue. Thus, in this paper, we propose a novel advertising strategy for the rec/ads trade-off. To be specific, we develop an RL-based framework that can continuously update its advertising strategies and maximize reward in the long run. Given a recommendation list, we design a novel Deep Q-network architecture that can determine three internally related tasks jointly, i.e., (i) whether to interpolate an ad or not in the recommendation list, and if yes, (ii) the optimal ad and (iii) the optimal location to interpolate. The experimental results based on real-world data demonstrate the effectiveness of the proposed framework.
연구 동기 및 목표
- 추천 시스템에서 광고 수익 극대화와 사용자 경험 유지 간의 상충 관계를 해결하기 위해.
- 광고 삽입 결정—광고 삽입 여부, 광고 선택, 삽입 위치—를 종합적으로 결정하는 통합 프레임워크를 개발하기 위해.
- 기존 DQN 아키텍처가 세 가지 상호의존적 결정 중 일부만 처리할 수 있는 한계를 극복하기 위해.
- 다양한 관련 행동을 동시에 평가할 수 있는 확장 가능한 딥 강화학습 솔루션을 설계하여 합리적인 시간 복잡도를 확보하기 위해.
- 단편 영상 플랫폼의 실생활 데이터를 바탕으로 프레임워크를 검증하여 기준 모델 대비 향상된 성능을 입증하기 위해.
제안 방법
- 광고 삽입 문제를 상태, 행동, 전이, 보상, 할인 요소를 갖춘 마르코프 결정 과정(MDP)으로 모델링한다.
- 추천 목록과 사용자 상태를 입력으로 받아, 광고 삽입 결정의 모든 조합에 대한 Q-값을 출력하는 새로운 딥 Q-네트워크(DQN) 아키텍처를 제안한다.
- 행동 공간은 세 가지 상호연관된 결정을 포함한다: 광고 삽입 여부(예/아님), 후보 집합에서의 광고 선택, 목록 내 삽입 위치.
- 보상 함수는 광고 수익(R^ad)과 사용자 경험 영향(R^ex)을 하이퍼파라미터 α로 가중하여 균형을 이룬다.
- 경험 재생과 타겟 네트워크를 사용하여 학습을 안정화시키며, 표준 DQN와 유사하지만 다차원 행동 공간에 적응한 방식으로 학습한다.
- 기존 방법과 달리, O(|A|·L) 평가가 필요 없이도 모든 행동 조합을 효율적으로 평가할 수 있도록 한다.
실험 결과
연구 질문
- RQ1딥 강화학습 프레임워크가 추천 목록 내 광고 삽입 결정—광고 삽입 여부, 광고 선택, 삽입 위치—를 종합적으로 최적화할 수 있는가?
- RQ2제안된 DEAR 프레임워크는 기존 방법 대비 광고 수익과 사용자 경험 영향을 어떻게 균형 잡는가?
- RQ3광고 수익과 사용자 경험 간의 상충 관계를 조정하는 하이퍼파라미터 α를 변화시켰을 때 전체 성능에 어떤 영향을 미치는가?
- RQ4제안된 새로운 DQN 아키텍처는 세 가지 결정 중 일부만 처리하는 기존 DQN 설계와 비교해 어떻게 다른가?
- RQ5제안된 프레임워크는 실생활 단편 영상 추천 데이터에서 성능을 얼마나 향상시키는가?
주요 결과
- DEAR는 실생활 단편 영상 데이터에서 누적 보상 10.96을 기록하여 모든 기준 모델을 압도적으로 뛰어넘었다.
- 가장 강력한 기준 모델(DEAR-5) 대비 12.58% 향상된 성능을 기록했으며, p-값 0.000으로 통계적으로 매우 유의미한 결과를 보였다.
- 모듈별 제거 실험 결과, DEAR의 각 모듈이 성능 향상에 기여했으며, DEAR-1은 기준 모델 대비 10.32% 향상된 성능을 기록했다.
- 파rameter 민감도 분석 결과, α를 증가시킬수록 사용자 경험(R^ex)이 향상되었지만 광고 수익(R^ad)은 감소했으며, 최적의 전체 성능는 α=1에서 달성되었다.
- 제안된 DQN 아키텍처는 기존 방법과 달리 O(|A|·L) 평가가 필요 없이도 세 가지 행동의 공동 결정을 효율적으로 처리하여 실용적 구현이 가능했다.
- 결과적으로, 광고 삽입 결정을 종합적으로 최적화할 경우, 각각을 별도로 최적화하는 것보다 더 높은 장기적 보상을 달성할 수 있음을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.