[논문 리뷰] Trustworthy Online Marketplace Experimentation with Budget-split Design
이 논문은 두쪽 시장에서의 실험적 프레임워크로 예산 분할 설계를 제안하며, 캠프에이션 예산을 처리군과 대조군으로 나누어 상호 간섭을 방지함으로써 상호 소모성 편향을 제거한다. 이는 편향 없는 추정과 높은 통계적 검정력을 달성하며, 기존 설계 대비 80%의 검정력으로 유의미한 제품 영향을 탐지할 수 있게 해주며, 이는 기존 설계에서 5–12%에 불과한 검정력에 비해 뚜렷한 향상이다. 이는 이전에 검정력 부족으로 인해 탐지되지 못했던 의미 있는 제품 영향을 탐지할 수 있게 한다.
Online experimentation, also known as A/B testing, is the gold standard for measuring product impacts and making business decisions in the tech industry. The validity and utility of experiments, however, hinge on unbiasedness and sufficient power. In two-sided online marketplaces, both requirements are called into question. The Bernoulli randomized experiments are biased because treatment units interfere with control units through market competition and violate the "stable unit treatment value assumption"(SUTVA). The experimental power on at least one side of the market is often insufficient because of disparate sample sizes on the two sides. Despite the important of online marketplaces to the online economy and the crucial role experimentation plays in product improvement, there lacks an effective and practical solution to the bias and low power problems in marketplace experimentation. Our paper fills this gap by proposing an experimental design that is unbiased in any marketplace where buyers have a defined budget, which could be finite or infinite. We show that it is more powerful than all other unbiased designs in literature. We then provide generalizable system architecture for deploying this design to online marketplaces. Finally, we confirm our findings with empirical performance from experiments run in two real-world online marketplaces.
연구 동기 및 목표
- 온라인 마켓플레이스 실험에서 시장 경쟁과 불균형한 표본 크기로 인한 편향과 낮은 통계적 검정력 문제를 해결하기 위해.
- 편향 없는 추정을 보장하는 실용적이고 가정이 적은 실험 설계를 개발하기 위해.
- 실제 사용자 및 캠프에이션 데이터를 활용해 실제 온라인 마켓플레이스에서 설계를 실증적으로 검증하기 위해.
- 예산 분할 설계가 캠프에이션 수준, 스위치백, 클러스터 기반 설계보다 편향 통제와 검정력 측면에서 뛰어나다는 것을 입증하기 위해.
제안 방법
- 예산 분할 설계는 각 캠프에이션에 총 예산을 할당하고, 이를 처리군과 대조군으로 나누어 단위 간 간섭을 방지한다.
- 잠재적 결과 프레임워크를 기반으로 관심 있는 결과에 대한 평균 처리 효과를 정의한다.
- 예산 분할 설계 하에서 처리 효과에 대한 편향 없는 추정량을 유도하며, 이는 시장 한쪽에서 예산을 분할할 수 있다는 존재 조건에만 의존한다.
- 일반화 가능한 시스템 아키텍처를 통해 대규모이고 생산 수준의 실험을 실제 마켓플레이스에서 구현할 수 있도록 한다.
- 실험은 두 표본 t-검정을 사용해 분석하며, 검정력 비교는 캠프에이션 수준 및 스위치백 설계와 비교한다.
- 예측 가능한 상호 간섭 편향 검증을 위해 예산 분할 설계 결과와 알려진 편향이 있는 회원 수준 실험 결과를 비교한다.
실험 결과
연구 질문
- RQ1두쪽 시장에서의 실험적 프레임워크를 어떻게 설계할 수 있을까? 이는 편향이 없고 검정력이 높아야 한다.
- RQ2기존 베르누이 랜덤화 실험에 비해 예산 분할 설계는 어느 정도 편향을 줄이는가?
- RQ3실제 마켓플레이스에서 예산 분할 실험의 통계적 검정력은 캠프에이션 수준 및 스위치백 실험과 비교해 어떻게 되는가?
- RQ4예산 분할 설계는 낮은 검정력을 가진 대안에서 놓친 의미 있는 처리 효과를 탐지할 수 있는가?
- RQ5상호 간섭을 고려하지 않은 표준 마켓플레이스 실험에서 상호 소모성 편향의 크기는 어느 정도인가?
주요 결과
- 예산 분할 실험은 처리 효과를 탐지하기 위해 80%의 통계적 검정력을 확보했으며, 캠프에이션 수준 실험은 각각 마켓플레이스 1에서 5.2%, 마켓플레이스 2에서 12%의 검정력만 확보했다.
- 스위치백 실험은 각각 5.1%와 5.2%의 검정력을 보였으며, 5% 유의수준 기준으로 약간 높을 뿐이어서 실질적으로는 효과가 없었다.
- 예산 분할 설계는 기존에 회원 수준 실험에서 처리 효과를 100–200% 과대평가하는 상호 소모성 편향을 완전히 제거했다.
- 이 설계 덕분에 이전에 캠프에이션 수준 실험에서 검정력 부족으로 인해 탐지되지 못했던, 연간 수백만 달러의 수익 손실을 초래하는 부정적 제품 영향을 탐지할 수 있었다.
- 실증 결과는 예산 분할 실험 설계가 간섭에 강건하며, 회원 수준 또는 캠프에이션 수준 설계에서 내재된 편향을 겪지 않는다는 것을 확인했다.
- 이 방법은 마켓플레이스 한쪽에서 예산을 분할할 수 있다는 조건 외에는 모델링 가정이 필요 없어, 실용적이고 널리 적용 가능한 실전 배포에 매우 적합하다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.