Skip to main content
QUICK REVIEW

[논문 리뷰] Sustainable Online Reinforcement Learning for Auto-bidding

Zhiyu Mou, Yusen Huo|arXiv (Cornell University)|2022. 10. 13.
Auction Theory and Applications인용 수 5
한 줄 요약

이 논문은 실제 광고 시스템(RAS)에서 자동 입찰 정책을 직접 훈련하는 지속 가능한 온라인 강화학습(SORL) 프레임워크를 제안한다. 이는 오프라인 가상 광고 시스템(VAS)과 RAS 간의 일관성 부족—즉, 온라인과 오프라인 간의 일관성 문제(IBOO)—를 해결한다. 리프시츠-스무쓰한 Q함수와 안전하고 효율적인 탐색(SER) 정책을 활용하여 SORL은 안정적이고 안전한 RAS와의 온라인 상호작용을 가능하게 하며, 분산을 억제하는 보수적 Q학습(V-CQL) 방법을 통해 강력한 정책 학습을 보장한다. 실제 A/B 테스트 결과, SORL은 최신 기술보다 14.79% 높은 구매 수와 12.90% 높은 ROI를 기록하였다.

ABSTRACT

Recently, auto-bidding technique has become an essential tool to increase the revenue of advertisers. Facing the complex and ever-changing bidding environments in the real-world advertising system (RAS), state-of-the-art auto-bidding policies usually leverage reinforcement learning (RL) algorithms to generate real-time bids on behalf of the advertisers. Due to safety concerns, it was believed that the RL training process can only be carried out in an offline virtual advertising system (VAS) that is built based on the historical data generated in the RAS. In this paper, we argue that there exists significant gaps between the VAS and RAS, making the RL training process suffer from the problem of inconsistency between online and offline (IBOO). Firstly, we formally define the IBOO and systematically analyze its causes and influences. Then, to avoid the IBOO, we propose a sustainable online RL (SORL) framework that trains the auto-bidding policy by directly interacting with the RAS, instead of learning in the VAS. Specifically, based on our proof of the Lipschitz smooth property of the Q function, we design a safe and efficient online exploration (SER) policy for continuously collecting data from the RAS. Meanwhile, we derive the theoretical lower bound on the safety of the SER policy. We also develop a variance-suppressed conservative Q-learning (V-CQL) method to effectively and stably learn the auto-bidding policy with the collected data. Finally, extensive simulated and real-world experiments validate the superiority of our approach over the state-of-the-art auto-bidding algorithm.

연구 동기 및 목표

  • 자신의 광고 시스템(VAS)이 실제 광고 시스템(RAS)을 정확히 시뮬레이션하지 못하는 문제—즉, 자동 입찰에서 온라인과 오프라인 간의 일관성 문제(IBOO)를 해결하기 위해.
  • VAS에서 훈련된 정책과 실제 운영 환경에서의 성능 간 격차를 해소하기 위해 RAS에서 직접 안전한 온라인 훈련을 가능하게 하기 위해.
  • 이론적으로 탄탄한 안전한 탐색 전략을 개발하여 온라인 상호작용 중 성능를 유지하면서 위험을 최소화하기 위해.
  • 온라인 데이터를 효과적으로 활용할 수 있는 안정적이고 보수적인 학습 방법(V-CQL)을 제안하기 위해.

제안 방법

  • IBOO를 VAS와 RAS 간의 격차로 공식적으로 정의하며, 주로 VAS에서 캐스케이드 입찰 아키텍처와 정적 시장 가격을 정확히 모델링하지 못하는 데 기인한다.
  • RAS 내 Q함수의 리프시츠 스무쓰함을 증명하여 온라인 탐색에 대한 이론적 안전 보장을 가능하게 한다.
  • 초기 조정 파rameter λ(안전성)과 σ(탐색 효율성)를 사용해 탐색과 안전성을 균형 잡는 안전하고 효율적인 탐색(SER) 정책을 설계한다.
  • 온라인 상호작용 중 최소한의 위험을 보장하기 위해 SER 정책의 안전성에 대한 이론적 하한을 유도한다.
  • 온라인으로 수집한 데이터를 활용해 분산을 감소시키고 샘플 효율성을 향상시켜 안정적인 오프라인-RL 방법을 제안한다: 분산 억제 보수적 Q학습(V-CQL).
  • SER와 V-CQL를 SORL 프레임워크에 통합하여 RAS에서 지속적이고 안전하며 고성능의 정책 훈련을 가능하게 한다.

실험 결과

연구 질문

  • RQ1실제 광고 시스템(RAS)에 배포될 때, VAS에서 훈련된 자동 입찰 정책의 성능이 온라인과 오프라인 간의 일관성 문제(IBOO)로 얼마나 떨어지는가?
  • RQ2RAS에서 직접 온라인 훈련을 수행하면 IBOO 문제를 제거하고 기존 오프라인 VAS 기반 훈련 대비 정책 성능을 향상시킬 수 있는가?
  • RQ3고위험, 실제 운영 환경에서의 안정적이고 안전한 온라인 탐색을 보장할 수 있는 이론적 및 알고리즘적 메커니즘은 무엇인가?
  • RQ4온라인으로 수집한 데이터를 사용할 때, 제안된 V-CQL 방법은 기존 오프라인 RL 방법 대비 학습 안정성과 성능을 어떻게 향상시키는가?
  • RQ5실제 A/B 테스트에서 SORL 프레임워크는 최신 자동 입찰 알고리즘보다 뛰어난 성능을 달성할 수 있는가?

주요 결과

  • 실제 A/B 테스트에서 SORL은 다중 에이전트 알고리즘 [36] 대비 14.79% 높은 구매 수와 12.90% 높은 ROI를 기록하여 뚜렷한 성능 향상을 입증하였다.
  • SORL은 모든 지표에서 최신 기술인 USCB 정책을 초월했다: BuyCnt +3.20%, ROI +3.75%, CPA -3.91%로 효율성과 비용 효율성이 향상됨을 보였다.
  • 실제 운영 환경에서 SORL은 기준 다중 에이전트 방법 대비 BuyCnt 14.79% 증가와 ROI 12.90% 증가를 달성하였다.
  • SER 정책은 안정적이고 안전한 탐색을 보였으며, 이론적 안전 경계가 실증 결과를 통해 검증되어 온라인 훈련 중 최소한의 위험을 보장하였다.
  • V-CQL은 분산을 효과적으로 억제하고 학습 안정성을 향상시켜 SER를 통해 수집한 온라인 데이터로부터 신뢰할 수 있는 정책 업데이트를 가능하게 하였다.
  • SORL 프레임워크는 IBOO 문제를 성공적으로 해결하였으며, RAS에서 직접 온라인 훈련이 전통적인 오프라인 VAS 기반 훈련보다 실현 가능하고 우월하다는 것을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.