Skip to main content
QUICK REVIEW

[論文レビュー] A framework for Multi-A(rmed)/B(andit) testing with online FDR control

Fanny Yang, Aaditya Ramdas|arXiv (Cornell University)|Jun 16, 2017
VLSI and Analog Circuit Testing被引用数 12
ひとこと要約

本稿では、マルチアームバンディット(MAB)テストとオンラインの誤発見率(FDR)制御を統合する新しいフレームワークを提案する。これにより、きめ細やかな誤差制御を伴う効率的で継続的モニタリング可能なA/Bテストが可能になる。常に有効な逐次p値と適応的サンプリングを用いることで、低サンプル数で高い検出力と任意時刻におけるFDR制御を達成し、逐次実験において誤検出を最小限に抑えつつ信頼性の高い優れた代替案の同定を実現する。

ABSTRACT

We propose an alternative framework to existing setups for controlling false alarms when multiple A/B tests are run over time. This setup arises in many practical applications, e.g. when pharmaceutical companies test new treatment options against control pills for different diseases, or when internet companies test their default webpages versus various alternatives over time. Our framework proposes to replace a sequence of A/B tests by a sequence of best-arm MAB instances, which can be continuously monitored by the data scientist. When interleaving the MAB tests with an an online false discovery rate (FDR) algorithm, we can obtain the best of both worlds: low sample complexity and any time online FDR control. Our main contributions are: (i) to propose reasonable definitions of a null hypothesis for MAB instances; (ii) to demonstrate how one can derive an always-valid sequential p-value that allows continuous monitoring of each MAB test; and (iii) to show that using rejection thresholds of online-FDR algorithms as the confidence levels for the MAB algorithms results in both sample-optimality, high power and low FDR at any point in time. We run extensive simulations to verify our claims, and also report results on real data collected from the New Yorker Cartoon Caption contest.

研究の動機と目的

  • 従来のA/Bテストの限界、すなわち均等なトラフィック配分、継続的モニタリングの安全性の欠如、逐次実験における誤発見率の不十分な制御を是正すること。
  • MABによる適応的サンプリングとオンラインFDR制御を統合した包括的なフレームワークを構築すること。
  • 継続的実験の進行中に、任意の時点で高い統計的検出力と低い誤発見率を両立させること。
  • タイプIエラー率の上昇を伴わずに継続的モニタリングが可能な理論的裏付けのある手法を提供すること。
  • インターネットA/Bテスト、臨床試験、政策評価など、効率的かつ信頼性の高い発見が不可欠な分野への実用的導入を可能とすること。

提案手法

  • MABインスタンスを逐次的に実行し、得られる発見にオンラインFDR制御を適用するメタアルゴリズムを提案する。
  • MABインスタンスのための帰無仮説の新しい定義を導入し、逐次的状況下でも有効な統計的推論を可能にする。
  • 各MAB検定に対して、常に有効な逐次p値を導出することで、タイプIエラーの増加なしに継続的モニタリングが可能になる。
  • オンラインFDRアルゴリズムの棄却閾値をMABの停止ルールの信頼水準として使用し、サンプル効率性とFDR制御の両立を実現する。
  • LUCBスタイルの信頼区間とLILに基づく境界を用いて、任意の停止時刻においても有効なp値を構築する。
  • オンラインFDR制御にBenjamini-Yekutieli手順を適用し、時間変動する有意水準に適応させる。

実験結果

リサーチクエスチョン

  • RQ1MABのサンプル効率性とオンラインFDRの誤差制御を統合したフレームワークを設計できるか?
  • RQ2任意の停止時刻においても有効なp値をMABに対して構築するにはどうすればよいか?これにより、罪の意識なく継続的モニタリングが可能になる。
  • RQ3オンラインFDR閾値をMABの信頼水準として使用する場合、低FDRと高検出力が両立する条件は何か?
  • RQ4提案手法は、逐次実験において近似的に最適なサンプル数を達成しながらも、FDR制御を維持できるか?
  • RQ5ユーザー行動が非i.i.d.なオンラインプラットフォームなど、複雑な現実世界のデータ環境でも、このフレームワークはどのように性能を発揮するか?

主な発見

  • LILに基づく信頼区間から導出された常に有効なp値を用いることで、連続的モニタリング下でも任意時刻においてオンラインFDR制御を達成する。
  • 理論的に証明された定理1により、すべての逐次実験において、誤発見率が目標水準α以下に抑えられることを保証する。
  • オンラインFDR閾値をMABの停止ルールの信頼水準として使用することで、サンプル効率性を維持しつつ高い検出力を実現する。
  • 合成データを用いたシミュレーションにより、名目水準でのFDR制御が確認されるとともに、均等サンプリングに比べてより速やかに優れたアームを同定できる。
  • ニューヨーカー・カルトゥーンキャプションコンテストの実データを用いた実験では、低誤発見率で優れたキャプションを的確に同定できた。
  • 理論的分析により、やや緩い条件下でも、近似的に最適なサンプル数と近似的に最適な発見率を達成でき、帰無仮説および非帰無仮説の両状況下でFDR制御が保証されることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。