[論文レビュー] A Practitioner's Guide to Multiple Testing Error Rates
本稿は、多重仮説検定における適切な誤差率の選択に関する実用的ガイドを提供し、家族全体の誤り率(FWER)、偽発見率(FDR)、および関連する指標を比較する。研究の文脈に応じてこれらの誤差率の間でどのように選択すべきかを示し、遺伝学、医療画像、心理学、教育政策分野の実世界の例を用いて説明する。FDRの制御は、大規模な検定状況ではFWERの制御よりもしばしばより強力で適切であることを強調する。
It is quite common in modern research, for a researcher to test many hypotheses. The statistical (frequentist) hypothesis testing framework, does not scale with the number of hypotheses in the sense that naively performing many hypothesis tests will probably yield many false findings. Indeed, statistical "significance" is evidence for the presence of a signal within the noise expected in a single test, not in a multitude. In order to protect himself from an uncontrolled number of erroneous findings, a researcher has to consider of the type or errors he wishes to avoid and select the adequate procedure for that particular error type and data structure. A quick search of the tag [multiple-comparisons] in the statistics Questions & Answers web site Cross Validates (http://stats.stackexchange.com) demonstrates the amount of confusion this task can actually cause. This was also a point made at the 2009 Multiple Comparisons conference in Tokyo. In an attempt to offer guidance, we review possible error types for multiple testing, and demonstrate them with some practical examples, which clarify the formalism. Finally, we include some notes on the software implementations of the methods discussed. The emphasis of this manuscript is on the error-rates, and not on the procedures themselves. We do try to name several procedures in this manuscript where appropriate. P-value adjustment will not be discussed as it is procedure specific. I.e., it is the choice of a procedure that defines the p-value adjustment, and not the error rate itself. Simultaneous confidence intervals will, also, not be discussed.
研究の動機と目的
- 多重仮説検定における一般的に用いられる誤差率—FWERとFDRの違いを明確にすること。
- 研究者の科学的目標とデータの文脈に基づいて、最も適切な誤差率を選択するためのガイドラインを提供すること。
- 遺伝学、医療画像、心理学、教育政策分野の実世界の例を通じて、誤差率選択の実践的影響を示すこと。
- 大規模な検定状況では、特に再現性と発見の優先が求められる場合、FDRの制御がFWERの制御よりもしばしばより強力で適切であることを強調すること。
- ベンジャミン=ホッジバーグ手順をFDRそのものと同一視することなどの一般的な誤解を解き、局所的fdrと後方確率が意思決定において果たす役割を明確にすること。
提案手法
- 家族全体の誤り率(FWER)、偽発見率(FDR)、およびその弱い制御・強い制御のバリエーションをレビューし定義する。
- 局所的偽発見率(local fdr)の概念を導入し、これはその検定統計量が与えられたときの帰無仮説が真である後方確率であると説明する。これは意思決定基準として用いられる。
- FDRが、すべての発見の中での偽発見の期待割合として定義されることを説明する:E[V/R] で、R=0 の場合はFDP=0 とみなす。
- 実用的な拒絶基準として、local fdr ≤ 0.2 を提案する。これは特定の条件下で、周辺的FDRの制御が約0.1に相当する。
- FDR ≤ α におけるFNRの最小化、またはmFDR ≤ α におけるmFNRの最小化といった最適化フレームワークを説明し、統計的パワーの向上を図る。
- local fdrに基づく手順は、帰無仮説の確率を検定統計量の分布から推定することに依存しており、非帰無効効果のクラスタリングを仮定していることを強調する。
実験結果
リサーチクエスチョン
- RQ1FWERとFDRの主な違いは何ですか。また、多重検定状況では、それぞれがいつ使用されるべきですか。
- RQ2研究者が科学的目標(例:偽陽性の最小化 vs. 真の発見の最大化)に基づいて適切な誤差率を選択するにはどうすればよいですか。
- RQ3局所的fdrは、大規模な仮説検定におけるパワーと解釈可能性をどのように向上させる役割を果たしますか。
- RQ4ベンジャミン=ホッジバーグ手順とFDRの関係は何か。なぜ両者を同一視するのは誤りなのでしょうか。
- RQ5遺伝関連性研究などの実世界の応用において、異なる誤差率の閾値(例:α = 0.05 と α = 0.1)を使用した場合の影響はどのようなものですか。
主な発見
- FWERの制御は、たとえ1件の偽発見であっても許されない状況(例:医薬品承認試験)ではより保守的であり、適切である。
- FDRの制御は、大規模な検定(例:ゲノム研究)においては、わずかな割合の偽発見が許容されるため、より強力で適切である。
- local fdrの閾値を0.2に設定することは、周辺的FDRの制御が約0.1に相当する近似値を提供し、実用的かつ解釈可能な意思決定ルールとなる。
- ベンジャミン=ホッジバーグ手順はFDR制御の1つの方法ではあるが、FDRそのものと同一視されるべきではない。これは一般的な誤解である。
- 既知の効果サイズ(例:予想されるz値が約7)がある状況では、事前知識を無視すると検出力が低下し、最適でない拒絶ルールが生じる。
- local fdrに基づく手順は、非帰無効効果がクラスタリングする場合に特に、検定統計量の経験的分布を活用することでパワーを向上させることができる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。