[논문 리뷰] Deep Reinforcement Learning for Sponsored Search Real-time Bidding
이 논문은 광고 입찰 동적 변화가 빈번하게 발생하는 실시간 입찰 환경에서의 안정성 문제를 해결하기 위해, 스폰서드 서치 입찰 경매(SS-RTB)를 위한 강력한 딥 강화학습 프레임워크인 RMDP를 제안한다. 입찰를 시간대별 집계 수준에서 모델링하고 제어-모델 기반 접근법을 사용함으로써 광고주 수익성을 향상시켰으며, 온라인 A/B 테스트에서 기준 방법 대비 평균 35.04% 향상된 PUR_AMT/COST를 달성했고, ROI 및 CVR 측면에서도 뚜렷한 성과 향상을 보였다.
Bidding optimization is one of the most critical problems in online advertising. Sponsored search (SS) auction, due to the randomness of user query behavior and platform nature, usually adopts keyword-level bidding strategies. In contrast, the display advertising (DA), as a relatively simpler scenario for auction, has taken advantage of real-time bidding (RTB) to boost the performance for advertisers. In this paper, we consider the RTB problem in sponsored search auction, named SS-RTB. SS-RTB has a much more complex dynamic environment, due to stochastic user query behavior and more complex bidding policies based on multiple keywords of an ad. Most previous methods for DA cannot be applied. We propose a reinforcement learning (RL) solution for handling the complex dynamic environment. Although some RL methods have been proposed for online advertising, they all fail to address the "environment changing" problem: the state transition probabilities vary between two days. Motivated by the observation that auction sequences of two days share similar transition patterns at a proper aggregation level, we formulate a robust MDP model at hour-aggregation level of the auction data and propose a control-by-model framework for SS-RTB. Rather than generating bid prices directly, we decide a bidding model for impressions of each hour and perform real-time bidding accordingly. We also extend the method to handle the multi-agent problem. We deployed the SS-RTB system in the e-commerce search auction platform of Alibaba. Empirical experiments of offline evaluation and online A/B test demonstrate the effectiveness of our method.
연구 동기 및 목표
- 스폰서드 서치에서 입찰 환경의 동적 변화가 심하고 매일 다르게 변하는 상황에서 효과적인 실시간 입찰 솔루션이 부족한 문제를 해결하기 위해.
- 기존 강화학습 방법이 환경 동역학이 정적임을 가정하지만, 이는 날짜 간 전이 확률 변화 시 실패하는 문제를 해결하기 위해.
- 다른 날짜 간 일관된 전이 패턴을 반영할 수 있는 시간대 집계 수준에서의 강력한 MDP 모델을 설계하여 정책 학습의 안정성을 확보하기 위해.
- 각 시간대별로 입찰 모델을 선택하는 제어-모델 프레임워크를 개발하여 직접 인상 단위 입찰을 생성하는 방식보다 확장성과 성능을 향상시키기 위해.
- 실제 광고 플랫폼에서 다수 광고주가 동시에 입찰하는 다중 에이전트 경쟁 환경을 다룰 수 있도록 방법을 확장하기 위해.
제안 방법
- 시간대 수준에서 입찰 시퀀스를 집계하고 다양한 날짜 간 전이 패턴을 안정화시키기 위해 강력한 마르코프 결정 프로세스(RMDP)를 수립한다.
- 집계된 입찰 데이터와 인상 특징을 기반으로 최적의 입찰 모델을 선택하는 입찰 정책을 학습하기 위해 딥 Q넷(DQN)을 사용한다.
- 입찰 결정 과정을 두 단계로 분해한다: (1) 시간대별로 입찰 모델을 선택하고, (2) 해당 모델을 사용해 실시간 입찰을 수행한다.
- 정책 학습과 실시간 실행을 분리하는 모델 기반 제어 전략을 도입하여 환경의 일일 변화에 대한 일반화 능력과 강건성을 향상시킨다.
- 다중 광고주 간 경쟁 상황을 고려해 M-RMDP를 도입하여 다중 에이전트 시나리오를 확장한다.
- DQN 학습 중 탐색과 이용의 균형을 맞추기 위해 감소하는 엘리프실-그리디 탐색 전략을 적용한다.
실험 결과
연구 질문
- RQ1스폰서드 서치 실시간 입찰에서 날짜 간 입찰 패턴이 크게 변화하는 비정적 환경을 효과적으로 다룰 수 있는 딥 강화학습 모델이 존재하는가?
- RQ2인상 수준이 아닌 시간대 수준에서 환경을 모델링하는 것이 입찰 정책의 강건성과 성능 향상에 기여하는가?
- RQ3시간대별로 입찰 모델을 선택하는 제어-모델 프레임워크가 장기적으로 광고주 수익성 측면에서 직접 인상 단위 입찰보다 뛰어난가?
- RQ4다수 광고주가 동시에 경쟁하는 다중 에이전트 환경에서 제안된 방법의 성능은 어떠한가?
- RQ5기준 입찰 전략 대비 주요 성과 지표인 PUR_AMT/COST, ROI, CVR 향상 정도는 어느 정도인가?
주요 결과
- 10개 광고에 대한 온라인 A/B 테스트에서 RMDP 모델은 키워드 입찰(KB) 기준 대비 평균 35.04% 향상된 PUR_AMT/COST를 달성했다.
- 모델은 ROI도 평균 21.38% 향상시키고 CVR도 평균 23.11% 향상시켜 주요 목표를 넘어서는 광범위한 성과 향상을 보였다.
- PPC는 평균 5.16% 향상되어 클릭 단가를 낮추면서도 전환율과 수익을 증가시키는 데 기여한 것으로 나타났다.
- 다중 에이전트 온라인 평가에서 M-RMDP는 KB와 RMDP를 모두 압도하며 PUR_AMT/COST에서 평균 13.01% 향상되고 CVR에서도 12.62% 향상된 성과를 기록했다.
- 수렴 분석 결과 안정적인 학습이 이루어졌으며, 약 1.5억 개의 배치 동안 DQN 손실이 감소했고, 목적 지표인 PUR_AMT는 지속적으로 향상되며 안정화되었다.
- 결과적으로 시간대 집계 기반 RMDP 모델이 '환경 변화 문제'를 효과적으로 완화하여 비정적 입찰 동역학 환경에서도 강력한 정책 학습이 가능함을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.