[논문 리뷰] Online Inference for Advertising Auctions
이 논문은 실시간 입찰 경매에서 입찰 정책 최적화와 광고 노출 영향을 동시에 추정하기 위해 다수의 손잡이 띠(arm) 문제로 모델링한 수정된 톰슨 샘플링 알고리즘을 제안한다. 기존 방법보다 낮은 경제적 손실을 달성하며, 입찰의 경제적 구조를 활용해 학습과 인과 추론을 통합한다.
Advertisers that engage in real-time bidding (RTB) to display their ads commonly have two goals: learning their optimal bidding policy and estimating the expected effect of exposing users to their ads. Typical strategies to accomplish one of these goals tend to ignore the other, creating an apparent tension between the two. This paper exploits the economic structure of the bid optimization problem faced by advertisers to show that these two objectives can actually be perfectly aligned. By framing the advertiser's problem as a multi-armed bandit (MAB) problem, we propose a modified Thompson Sampling (TS) algorithm that concurrently learns the optimal bidding policy and estimates the expected effect of displaying the ad while minimizing economic losses from potential sub-optimal bidding. Simulations show that not only the proposed method successfully accomplishes the advertiser's goals, but also does so at a much lower cost than more conventional experimentation policies aimed at performing causal inference.
연구 동기 및 목표
- 실시간 입찰(RTB) 경매에서 최적의 입찰 정책을 학습하는 것과 광고 노출 영향을 추정하는 것 사이의 갈등을 해결하기 위해.
- 성능을 희생시키지 않고 두 목표를 동시에 달성하는 통합 프레임워크를 개발하기 위해.
- 학습 과정 중에 최적화되지 않은 입찰으로 인한 경제적 손실을 최소화하기 위해.
- RTB의 경제적 구조를 활용하여 학습을 위한 탐색과 인과 추론을 위한 추정을 일치시키기 위해.
- 높은 경제적 비용을 치르는 것으로 인과 추론을 우선시하는 전통적 실험 정책을 초월하기 위해.
제안 방법
- 광고주의 입찰 최적화 문제를 다수의 손잡이 띠(MAB) 문제로 재정의한다.
- 실시간 입찰 환경에서 탐색과 이용의 균형을 이루기 위해 수정된 톰슨 샘플링 알고리즘을 제안한다.
- 알고리즘은 최적의 입찰 정책을 동시에 학습하고 광고 노출의 기대 영향을 추정한다.
- 입찰의 경제적 구조를 활용하여 탐색이 과도한 손실을 유발하지 않도록 보장한다.
- 관측된 입찰 결과를 바탕으로 후행 분포를 기반으로 한 입찰 값의 확률적 샘플링을 사용한다.
- 재해로와 경제적 손실을 최소화하면서도 효과 추정의 통계적 정확성을 유지한다.
실험 결과
연구 질문
- RQ1실시간 입찰에서 최적의 입찰 정책을 학습하고 광고 노출의 인과 효과를 동시에 추정할 수 있는가?
- RQ2학습을 위한 탐색을 어떻게 설계하면 경제적 손실를 최소화하면서도 정확한 인과 추론이 가능하게 할 수 있는가?
- RQ3기존의 실험 정책에 비해 제안된 방법이 얼마나 더 낮은 경제적 비용을 초래하는가?
- RQ4입찰의 경제적 구조를 활용해 학습과 추정을 통합하면 광고주 전반의 성능이 향상되는가?
- RQ5수정된 톰슨 샘플링 알고리즘이 예산 제약 하에서 탐색과 이용을 효과적으로 균형 잡을 수 있는가?
주요 결과
- 제안된 방법은 최적의 입찰 정책을 학습하고 광고 노출 영향을 동시에 추정하는 데 성공한다.
- 기존의 실험 정책에 비해 훨씬 낮은 경제적 비용으로 두 목표를 달성한다.
- 시뮬레이션 결과, 알고리즘이 재해로를 최소화하고 효과 추정의 정확도를 유지함을 입증한다.
- 학습과 추정의 통합은 RTB 입찰 메커니즘의 본질적인 경제적 구조 덕분에 가능해진다.
- 수정된 톰슨 샘플링 알고리즘은 예산 제약 하에서 탐색과 이용의 균형을 더 효과적으로 유지한다.
- 학습과 인과 추론 간의 상충관계를 줄여 실세계 적용에 더 효율적으로 기여한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.