[論文レビュー] Changing the paradigm of fixed significance levels: Testing Hypothesis by Minimizing Sum of Errors Type I and Type II
この論文は、固定された有意水準を、第一種および第二種の誤りの重み付き和を最小化する手法に置き換えることで、統計的仮説検定のパラダイム転換を提案する。予測的に一致する事前分布に基づくベイズ因子を用いることで、最適かつ一貫性のある検定が達成され、尤度の原理を尊重し、頻度主義的およびベイズ的アプローチを調和させ、p値や固定されたα水準に対するよりバランスの取れた、科学的に整合性のある代替手法を提供する。
Our purpose, is to put forward a change in the paradigm of testing by generalizing a very natural idea exposed by Morris DeGroot (1975) aiming to an approach that is attractive to all schools of statistics, in a procedure better suited for the needs of science. DeGroot's seminal idea is to base testing statistical hypothesis on minimizing the weighted sum of type I plus type II error instead of of the prevailing paradigm which is fixing type I error and minimizing type II error. DeGroot's result is that in simple vs simple hypothesis the optimal criterion is to reject, according to the likelihood ratio as the evidence (ordering) statistics using a fixed threshold value, instead of a fixed tail probability. By defining expected type I and type II errors, we generalize DeGroot's approach and find that the optimal region is defined by the ratio of evidences, that is, averaged likelihoods (with respect to a prior measure) and a threshold fixed. This approach yields an optimal theory in complete generality, which the Classical Theory of Testing does not. This can be seen as a Bayes-Non-Bayes compromise: the criteria (weighted sum of type I and type II errors) is Frequentist, but the test criterion is the ratio of marginalized likelihood, which is Bayesian. We give arguments, to push the theory still further, so that the weighting measures (priors)of the likelihoods does not have to be proper and highly informative, but just predictively matched, that is that predictively matched priors, give rise to the same evidence (marginal likelihoods) using minimal (smallest) training samples. The theory that emerges, similar to the theories based on Objective Bayes approaches, is a powerful response to criticisms of the prevailing approach of hypothesis testing, see for example Ioannidis (2005) and Siegfried (2010) among many others.
研究の動機と目的
- 固定された第一種誤り率が、特に大きな標本で制御不能な第二種誤りを引き起こす、従来の仮説検定における科学的不整合性と不均衡を是正すること。
- 1975年にモリス・デグロートが提示した、第一種および第二種誤りの重み付き和を最小化するアイデアを、単純対単純仮説にとどまらず、複合モデルへと一般化すること。
- 尤度の原理とオプショナルストップピングを尊重し、頻度主義的およびベイズ的アプローチを調和させる、一般的で最適な検定フレームワークの構築。
- 適切な事前分布は必要ではなく、最小限の訓練標本に一致する予測的に一致する不適切な事前分布があれば、周辺化尤度を通じて有効かつ一貫性のある証拠が得られることを示すこと。
- p値や固定されたα水準に対する広範な批判に応えるために、実用的有意差がほとんどないにもかかわらず非常に小さなp値で帰無仮説を棄却するというパラドックスを回避する手法を提示すること。
提案手法
- パrameter空間における事前分布を用いて期待誤差を定義することで、第一種および第二種誤りの重み付き和を最小化する。
- 最適な棄却域は、周辺尤度(証拠)の比として定義され、適切な事前分布下ではベイズ因子に一致する。
- 各仮説下で一定の損失関数を仮定することで、最適な検定統計量としてベイズ因子が得られる。
- 実用的有意差を考慮するため、差が閾値Δ未満である場合は無視可能とみなす不利益領域を導入し、証拠比をそれに合わせて調整する。
- 最小限の訓練標本に一致する不適切だが調整済みの予測的事前分布を用いることで、適切な事前分布を必要とせず、一貫性と有効性を確保する。
- 決定理論に基づく理論的基盤において、固定されたp値やα水準ではなく、平均化された尤度(証拠)の比を固定閾値と比較する検定基準を採用する。
実験結果
リサーチクエスチョン
- RQ1事前にαを固定せずに、第一種および第二種誤りをバランスさせる一般的で最適な仮説検定フレームワークを開発することは可能か?
- RQ2第一種および第二種誤りの重み付き和を最小化する手法と、伝統的なネイマン=ピアソン検定とを比較した場合、一貫性および誤り制御の観点でどのような差が生じるか?
- RQ3最小限の訓練データに予測的に一致するように調整された不適切な事前分布を、仮説検定に意味的に有用に使用できる範囲はどの程度か?
- RQ4なぜp値は大きな標本で誤った結論を導くのか?また、証拠に基づく基準を用いることで、その問題をどのように回避できるか?
- RQ5尤度の原理とオプショナルストップピングを尊重しながら、最適かつ一貫性のある検定を実現することは可能か?
主な発見
- N=104,490,000、S=52,263,471 の大標本の二項分布例において、p値は0.0003であったが、ジェフレーズの事前分布下でのベイズ因子は18.7に達し、帰無仮説に強い証拠があることを示した。
- 実用的有意差の閾値Δ=0.0005(0.05%)を設定した場合、対立仮説に対する証拠比は5.1×10^10に達し、非常に小さなp値にもかかわらず、帰無仮説に圧倒的な支持があることが示された。
- この手法は一貫性を保証する:証拠が増加するにつれ、重み付き和を最小化する限り、第一種および第二種誤りは両方とも0に収束する。
- 最適な検定は尤度の原理とオプショナルストップピングの原理を満たすが、p値に基づく手法とは異なり、それらを満たさない。
- 最適な検定における第一種誤りと第二種誤りの比は、b/aによって上限が定められ、この手法が相対的誤りトレードオフを本質的に制御していることが示された。
- 不適切な事前分布であっても、それが最小限の訓練データに予測的に一致していれば、得られる証拠(周辺尤度)は有効であり、同じ最適な意思決定ルールが得られる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。