[논문 리뷰] Online Ad Procurement in Non-stationary Autobidding Worlds
이 논문은 비정상적인 오토배이딩 환경에서 밴딧 피드백과 불확실한 장기 제약 조건을 고려한 광고 캠페인 레버리지의 동적 최적화를 위한 원시-이중 온라인 학습 알고리즘을 제안한다. 이 알고리즘은 데이터 생성 과정에 대한 사전 지식 없이도 다양한 비정상적 환경—확률적, 적대적, 오염된, 주기적, 에르고딕—에서 낮은 회귀를 달성하며, 실세계 온라인 광고 플랫폼에서 광고주 의사결정의 강건성을 보장한다.
Today's online advertisers procure digital ad impressions through interacting with autobidding platforms: advertisers convey high level procurement goals via setting levers such as budget, target return-on-investment, max cost per click, etc.. Then ads platforms subsequently procure impressions on advertisers' behalf, and report final procurement conversions (e.g. click) to advertisers. In practice, advertisers may receive minimal information on platforms' procurement details, and procurement outcomes are subject to non-stationary factors like seasonal patterns, occasional system corruptions, and market trends which make it difficult for advertisers to optimize lever decisions effectively. Motivated by this, we present an online learning framework that helps advertisers dynamically optimize ad platform lever decisions while subject to general long-term constraints in a realistic bandit feedback environment with non-stationary procurement outcomes. In particular, we introduce a primal-dual algorithm for online decision making with multi-dimension decision variables, bandit feedback and long-term uncertain constraints. We show that our algorithm achieves low regret in many worlds when procurement outcomes are generated through procedures that are stochastic, adversarial, adversarially corrupted, periodic, and ergodic, respectively, without having to know which procedure is the ground truth. Finally, we emphasize that our proposed algorithm and theoretical results extend beyond the applications of online advertising.
연구 동기 및 목표
- 제한된 피드백과 비정상적 시장 조건 하에서 동적이고 고차원적인 레버리지 최적화 문제에 도전한다.
- 데이터 생성 과정에 대한 사전 지식 없이도 다양한 유형의 비정상적 조달 환경에서 잘 작동하는 통합 알고리즘을 개발한다.
- 관측 가능한 것은 결과뿐이지 전체 함수 값이 아닌 밴딧 피드백 환경에서 장기 제약 조건(예: 예산, ROI)을 충족시킨다.
- 실세계 광고 조달을 함수값을 갖는 밴딧 피드백과 불확실한 제약 조건을 가진 온라인 제약 최적화 문제로 모델링한다.
- 이론적 보장을 비정상적 환경—확률적, 적대적, 주기적으로 변화하는 결과 포함—으로 확장한다.
제안 방법
- 레버 결정을 다차원 변수로 모델링하면서, 밴딧 피드백과 불확실한 제약 조건을 가진 온라인 제약 최적화 문제로 광고 조달 문제를 수립한다.
- 제약 조건을 위한 이중 변수를 유지하고, 적응형 스텝 사이즈를 사용하는 투영된 경사 하강 업데이트를 적용하는 원시-이중 알고리즘을 도입한다.
- 후보 레버 구성에 대한 지수 가중치를 통한 랜덤 탐색 전략을 활용해 탐색과 이용의 균형을 이룬다.
- 홉핑의 보조정리와 볼록 해석을 사용하여, 함수 변화, 제약 위반, 결정 직경을 기반으로 회귀를 근사한다.
- 일반적인 함수의 미끄러움과 유한한 기울기 조건 하에서, 특정 비정상 과정에 의존하지 않고 시간에 대해 다항하강적으로 증가하는 회귀 상한을 유도한다.
- 전체 함수 피드백이 없는 상황에서 기울기를 추정하기 위해 단위 구면에서 균일하게 샘플링하는 스무딩 기법을 적용한다.
실험 결과
연구 질문
- RQ1데이터 생성 과정에 대한 사전 지식 없이도 하나의 온라인 학습 알고리즘이 다양한 비정상적 조달 환경에서 낮은 회귀를 달성할 수 있는가?
- RQ2밴딧 피드백만 제공되는 상황에서 광고주가 장기 예산 및 ROI 제약 조건 하에서 다수의 광고 캠페인 레버리지를 어떻게 동적으로 최적화할 수 있는가?
- RQ3불확실하고 시간에 따라 변화하는 제약 조건과 부분 피드백 하에서 온라인 최적화에 대해 어떤 이론적 보장을 제공할 수 있는가?
- RQ4원시-이중 방법은 비정상적 환경에서 함수값을 갖는 피드백과 다차원 결정 변수를 다루기 위해 어떻게 적응시킬 수 있는가?
- RQ5알고리즘이 동시에 적대적, 확률적, 주기적으로 변화하는 환경에서 낮은 회귀를 유지할 수 있는가?
주요 결과
- 제안된 알고리즘은 일반적인 비정상 조건—확률적, 적대적, 주기적 결과 포함—하에서 시간 T에 대해 하한 회귀를 달성하며, 상한이 O(√T)로 제한된다.
- 알고리즘은 시간이 지남에 따라 낮은 제약 위반을 보장하며, 누적 제약 위반에 대한 이론적 상한이 T에 대해 하한으로 증가한다.
- 비정상 과정의 유형에 대한 사전 지식 없이도 알고리즘이 다양한 실세계 광고 시장 역학에 강건함을 보장한다.
- 알고리즘의 성능은 비정상성의 구체적 성격—독립 동일분포, 적대적, 주기적 변화—과 무관하게 유지된다.
- 이론적 분석을 통해 알고리즘이 적대적 오염과 에르고딕 비정상 과정 하에서도 낮은 회귀를 유지함을 확인한다.
- 이 방법은 온라인 광고를 넘어서 불확실성과 부분 피드백 하에서의 온라인 최적화를 위한 일반적 프레임워크를 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.