[論文レビュー] On Online Control of False Discovery Rate
本稿では、過去の情報のみを用いてリアルタイムに意思決定を行う逐次的多重仮説検定において、誤り発見率(FDR)およびマージナルFDR(mFDR)を制御するオンライン手順LORDとLORDを導入する。これらの手法は任意の従属構造下でもFDR制御を保証し、スパースな代替仮説を伴う混合モデル下でほぼ線形の発見率を達成する。
Multiple hypotheses testing is a core problem in statistical inference and arises in almost every scientific field. Given a sequence of null hypotheses $\mathcal{H}(n) = (H_1,..., H_n)$, Benjamini and Hochberg \cite{benjamini1995controlling} introduced the false discovery rate (FDR) criterion, which is the expected proportion of false positives among rejected null hypotheses, and proposed a testing procedure that controls FDR below a pre-assigned significance level. They also proposed a different criterion, called mFDR, which does not control a property of the realized set of tests; rather it controls the ratio of expected number of false discoveries to the expected number of discoveries. In this paper, we propose two procedures for multiple hypotheses testing that we will call "LOND" and "LORD". These procedures control FDR and mFDR in an \emph{online manner}. Concretely, we consider an ordered --possibly infinite-- sequence of null hypotheses $\mathcal{H} = (H_1,H_2,H_3,...)$ where, at each step $i$, the statistician must decide whether to reject hypothesis $H_i$ having access only to the previous decisions. To the best of our knowledge, our work is the first that controls FDR in this setting. This model was introduced by Foster and Stine \cite{alpha-investing} whose alpha-investing rule only controls mFDR in online manner. In order to compare different procedures, we develop lower bounds on the total discovery rate under the mixture model and prove that both LOND and LORD have nearly linear number of discoveries. We further propose adjustment to LOND to address arbitrary correlation among the $p$-values. Finally, we evaluate the performance of our procedures on both synthetic and real data comparing them with alpha-investing rule, Benjamin-Hochberg method and a Bonferroni procedure.
研究の動機と目的
- 仮説の数が無限である可能性があり、かつ過去の情報のみを用いて意思決定を行うオンラインで逐次的な多重仮説検定におけるFDR制御の課題に対処すること。
- 従来の手法(αインベストメントやBenjamini-Hochbergなど)の制限を克服し、オンライン環境下でFDRおよびmFDRを制御する手順を開発すること。
- スパースな非ノンアルターを伴う混合モデル下で、発見率の理論的保証を確立すること。
- p値間の任意の相関を扱えるLORDのロバストな変種を提案すること。
- 合成データおよび実データを用いた実験的評価を通じて、Benjamini-Hochberg、αインベストメント、Bonferroniなどの既存手法と比較しての性能を検証すること。
提案手法
- 過去の発見に基づく適応的臨界値を用いて、FDRおよびmFDRをそれぞれ制御するオンライン手順LORD(Lond)およびLORD(Lord)を提案する。
- 過去の発見数と減衰パラメータに基づいて動的に調整される、再帰的更新則を用いた有意水準臨界値の更新ルールを採用する。
- 混合モデル下で再生過程の枠組みを用いて、期待発見数の理論的上限を導出する。
- p値間の任意の従属構造を扱えるように修正されたLORDのバージョンを導入する。
- 確率的優位性の議論と再生理論を用いて、期待間隔発見時間の有界性を証明し、線形発見率を保証する。
- 再帰的不等式と帰納法による証明を用いて、臨界値の期待経路からの逸脱が時間経過に伴って有界に保たれることを示す。
実験結果
リサーチクエスチョン
- RQ1仮説が1件ずつ到着し、過去の情報のみを用いて意思決定を行うオンラインで逐次的な多重仮説検定フレームワークにおいて、FDRを制御することは可能か?
- RQ2仮説総数の知識が得られない状況下で、発見力とFDR制御の最適なトレードオフは何か?
- RQ3混合モデル下で、真の非ノンアルターのスパarsityに応じて、オンラインFDR手順の発見率はどのようにスケーリングするか?
- RQ4p値間に任意の従属関係がある場合でもFDR制御を維持できるか? また、このような従属関係はどのように是正できるか?
- RQ5LORDとLORDは、Benjamini-Hochberg や αインベストメントといった古典的手法と比較して、実験的にどの程度の性能を示すか?
主な発見
- LORDおよびLORDは、各仮説が固定確率εで非ノンアルターであり、非ノンアルター下でp値がi.i.d.である混合モデル下で、ほぼ線形の発見率を達成する。
- 期待発見数は、テストされた仮説数に比例して線形に増加し、平均間隔発見時間μの逆数1/μに近づく。
- これらの手順はオンライン環境下でFDRおよびmFDRを制御し、修正版LORDを用いることで任意の従属構造下でもFDR制御が保証されている。
- 理論的分析により、臨界値の期待経路からの逸脱が時間経過に伴って有界に保たれることを示し、安定性と長期的制御を保証する。
- 合成データおよび実データを用いた実験的評価により、LORDおよびLORDはαインベストメント、Benjamini-Hochberg、Bonferroniを上回る発見力とFDR制御を同時に達成する。
- 仮説総数が不明または無限であっても、期待誤り発見数の上限が保証される強固な理論的保証を達成する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。