Skip to main content
QUICK REVIEW

[論文レビュー] Anytime-Valid Inference for Multinomial Count Data

Michael Lindon, Alan Malek|arXiv (Cornell University)|Nov 6, 2020
Statistical Methods in Clinical Trials被引用数 6
ひとこと要約

本論文は、任意の停止時における有意性を保証するフレームワークを提案する。このフレームワークは、信頼区間系列と逐次検定を用いて、任意停止および連続監視下でも第一種誤り率を制御する。マルチノミアルカウントデータのためのリアルタイム仮説検定と推定を可能にし、非定常なベルヌーイ分布およびポアソン過程に対して適用可能である。確率ベクトル、対数確率の差、強度比の信頼区間系列を構築することで、コンversion率テストやソフトウェアキャニオン監視への応用が実証された。

ABSTRACT

Many experiments are concerned with the comparison of counts between treatment groups. Examples include the number of successful signups in conversion rate experiments, or the number of errors produced by software versions in canary experiments. Observations typically arrive in data streams and practitioners wish to continuously monitor their experiments, sequentially testing hypotheses while maintaining Type I error probabilities under optional stopping and continuation. These goals are frequently complicated in practice by non-stationary time dynamics. We provide practical solutions through sequential tests of multinomial hypotheses, hypotheses about many inhomogeneous Bernoulli processes and hypotheses about many time-inhomogeneous Poisson counting processes. For estimation, we further provide confidence sequences for multinomial probability vectors, all contrasts among probabilities of inhomogeneous Bernoulli processes and all contrasts among intensities of time-inhomogeneous Poisson counting processes. Together, these provide an "anytime-valid" inference framework for a wide variety of experiments dealing with count outcomes, which we illustrate with a number of industry applications.

研究の動機と目的

  • 非定常的かつ時間的に変化する条件下で、カウントデータを用いたオンライン実験において、有効な統計的推論を維持する課題に対処すること。
  • 固定標本サイズの検定の限界を克服し、複数の検定補正を必要とせず、第一種誤り率が上昇しないように、継続的監視とデータ依存的停止を可能にすること。
  • A/Bテストやシステム監視で一般的な、マルチノミアル、非定常ベルヌーイ、時間非定常ポアソン過程の実用的逐次推論ツールを提供すること。
  • 確率ベクトルおよび対数確率・対数強度の差のための柔軟でリアルタイムな仮説検定を可能にする、信頼区間系列の構築。
  • 本フレームワークの実世界応用における有効性を、サンプルレート不一致検出、コンversion率最適化、ソフトウェアキャニオンテストの事例を通じて示すこと。

提案手法

  • 混合マルティンググールを用いて、任意の停止時における有効なカバレッジを保証するマルチノミアル確率ベクトルの信頼区間系列を構築する。
  • 観測された成功回数のみに基づき、失敗観測を必要としない、複数の非定常ベルヌーイ過程の等価性を検定する逐次検定を導出する。
  • 時間非定常ポアソン過程へフレームワークを拡張し、強度比および対数強度の差の信頼区間系列を構築する。
  • マルチノミアル信頼区間系列を基盤として、すべてのペairwiseおよび一般の差の同時信頼区間系列を構築する。
  • 尤度比統計量を用いて逐次p値を構築し、任意停止および継続条件下でも有効性を保つ。
  • 凸最適化を用いて信頼区間系列を効率的に計算し、ストリーミングデータ環境におけるリアルタイム実装を可能にする。

実験結果

リサーチクエスチョン

  • RQ1観測が逐次的に到着し、成功確率が時間とともに変化する状況下で、カウントデータを用いたオンライン実験において、どのようにして有効な統計的推論を維持できるか?
  • RQ2任意停止および連続監視下でも有効なまま保たれる、マルチノミアルパラメータおよび対数確率の差のための信頼区間系列を構築できるか?
  • RQ3失敗イベントが観測不能な状況下で、成功イベントのみが観測可能な場合に、非定常ベルヌーイ過程の逐次検定を実際の現場でどの程度適用できるか?
  • RQ4時間非定常ポアソン過程における強度比の信頼区間系列を、リアルタイムシステム監視での異常検出にどのように応用できるか?
  • RQ5本フレームワークは、データの定常性に関する仮定を最小限に抑えつつ、コンversion率最適化やソフトウェアキャニオンテストといった実世界のオンライン実験シナリオに適用可能か?

主な発見

  • マルチノミアル確率ベクトルの信頼区間系列は、任意の停止時においても有効なカバレッジを維持し、第一種誤り率の上昇なしにいつでも有効な推論を可能にする。
  • 非定常ベルヌーイ過程の逐次検定は、失敗観測を必要とせず、成功確率が時間的に変化する中でも、コンバージョンレートの差を検出可能である。
  • ソフトウェアキャニオンテストの事例では、強度比 $\lambda_1(t)/\lambda_0(t)$ の信頼区間系列が1.0未満に下がるまでに1秒未塔を要し、深刻なバグの迅速な検出が可能になった。
  • すべてのアーム間の差の同時推論が、多重仮説検定補正を必要とせず、同時に信頼区間系列を構築することで可能になる。
  • 逐次p値は、任意停止および継続条件下でも有効であり、統計的保証のもとで自動的かつ人為的介入なしに実験を終了可能である。
  • 固定標本サイズ法と比較して、実験期間とリソース使用量を大幅に削減でき、実験とイノベーションのスピードが向上する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。