[論文レビュー] Trustworthy Online Marketplace Experimentation with Budget-split Design
本論文は、キャンペーン予算を処理群と対照群に分割することで、相互干渉バイアスを排除する新しい実験枠組み「予算分割設計」を提案する。この設計により不偏推定が達成され、統計的パワーが著しく向上し、代替設計と比較して80%のパワー検出能力を示す一方、他の設計では5–12%にとどまる。これにより、従来の低パワーのため検出できなかった有意義な製品効果を検出可能にする。
Online experimentation, also known as A/B testing, is the gold standard for measuring product impacts and making business decisions in the tech industry. The validity and utility of experiments, however, hinge on unbiasedness and sufficient power. In two-sided online marketplaces, both requirements are called into question. The Bernoulli randomized experiments are biased because treatment units interfere with control units through market competition and violate the "stable unit treatment value assumption"(SUTVA). The experimental power on at least one side of the market is often insufficient because of disparate sample sizes on the two sides. Despite the important of online marketplaces to the online economy and the crucial role experimentation plays in product improvement, there lacks an effective and practical solution to the bias and low power problems in marketplace experimentation. Our paper fills this gap by proposing an experimental design that is unbiased in any marketplace where buyers have a defined budget, which could be finite or infinite. We show that it is more powerful than all other unbiased designs in literature. We then provide generalizable system architecture for deploying this design to online marketplaces. Finally, we confirm our findings with empirical performance from experiments run in two real-world online marketplaces.
研究の動機と目的
- オンラインマーケットプレイスの実験において、市場競争やサンプルサイズの不均衡によって生じるバイアスと低統計的パワーを是正すること。
- 二面的マーケットプレイスにおいて不偏推定を保証する、仮定が少なく実用的な実験設計を開発すること。
- 実際のユーザーおよびキャンペーンデータを用いた実世界のオンラインマーケットプレイスで、この設計を実証的に検証すること。
- 予算分割実験が、キャンペーンレベル、スイッチバック、クラスターベースの設計と比較して、バイアス制御およびパワーの両面で優れていることを示すこと。
提案手法
- 予算分割設計では、各キャンペーンに合計予算を割り当て、これを処理群と対照群に分割することで、単位間の干渉を回避する。
- 潜在的アウトカムフレームワークに基づき、関心のあるアウトカムに対する平均処理効果の推定量を定義する。
- 予算が一方の市場側で分割可能であるという前提のみに依存して、処理効果の不偏推定量を導出する。
- 一般化可能なシステムアーキテクチャを用いて実装され、大規模かつ生産環境向けの実験が可能になる。
- 実験は二標本t検定で分析され、パワー比較はキャンペーンレベルおよびスイッチバック設計と比較して行う。
- 相互干渉バイアスに対するロバスト性は、既知のバイアスを含むメンバー単位の実験と比較することで検証される。
実験結果
リサーチクエスチョン
- RQ1二面的オンラインマーケットプレイス向けに、不偏かつ高いパワーを持つ実験枠組みをどのように設計できるか。
- RQ2予算分割設計は、従来のベルヌーイ確率的ランダム化実験と比較して、どの程度バイアスを低減するか。
- RQ3実世界のマーケットプレイスにおいて、予算分割実験の統計的パワーはキャンペーンレベルおよびスイッチバック実験と比べてどの程度か。
- RQ4予算分割設計は、低パワーの代替設計では検出できない有意義な処理効果を検出できるか。
- RQ5干渉が考慮されない場合、標準的なマーケットプレイス実験における相互干渉バイアスの大きさはどの程度か。
主な発見
- 予算分割実験では処理効果を検出するための統計的パワーが80%に達したが、キャンペーンレベル実験ではそれぞれMarketplace 1で5.2%、Marketplace 2で12%にとどまった。
- スイッチバック実験のパワーはそれぞれ5.1%および5.2%であり、有意水準5%をわずかに上回るにとどまり、実用上は効果がほとんどない。
- 予算分割設計により相互干渉バイアスが完全に排除され、メンバー単位の実験では処理効果が100–200%過大評価されるのを防いだ。
- この設計により、従来のキャンペーンレベル実験の低パワーのため検出できなかった、年間数百万ドル規模の負の製品影響を検出可能となった。
- 実証的結果から、予算分割実験が干渉に対してロバストであり、メンバー単位やキャンペーンレベルの設計に内在するバイアスを有しないことが確認された。
- この手法は、マーケットプレイスの一方の側で予算が分割可能であるという前提のみを必要とし、モデリング仮定が最小限であるため、実世界への広範な適用が可能で実用的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。