Skip to main content
QUICK REVIEW

[論文レビュー] Statistical inference optimized with respect to the observed sample for single or multiple comparisons

David R. Bickel|arXiv (Cornell University)|Oct 4, 2010
Statistical Methods in Clinical Trials参考文献 44被引用数 16
ひとこと要約

本稿では、正規化最大尤度(NML)比に基づく、事前分布を必要とせず、単純な帰無仮説の裏付けの強さを測る新しい統計的証拠の尺度「識別情報(DI)」を導入する。この手法はミニマックス最適であり、漸近的に解釈可能で、偶然の情報に対して頑健であり、小さな標本サイズ下でも多重比較に対する感度が最小限に抑えられるため、従来のp値補正の必要性が低減される。

ABSTRACT

The normalized maximum likelihood (NML) is a recent penalized likelihood that has properties that justify defining the amount of discrimination information (DI) in the data supporting an alternative hypothesis over a null hypothesis as the logarithm of an NML ratio, namely, the alternative hypothesis NML divided by the null hypothesis NML. The resulting DI, like the Bayes factor but unlike the p-value, measures the strength of evidence for an alternative hypothesis over a null hypothesis such that the probability of misleading evidence vanishes asymptotically under weak regularity conditions and such that evidence can support a simple null hypothesis. Unlike the Bayes factor, the DI does not require a prior distribution and is minimax optimal in a sense that does not involve averaging over outcomes that did not occur. Replacing a (possibly pseudo-) likelihood function with its weighted counterpart extends the scope of the DI to models for which the unweighted NML is undefined. The likelihood weights leverage side information, either in data associated with comparisons other than the comparison at hand or in the parameter value of a simple null hypothesis. Two case studies, one involving multiple populations and the other involving multiple biological features, indicate that the DI is robust to the type of side information used when that information is assigned the weight of a single observation. Such robustness suggests that very little adjustment for multiple comparisons is warranted if the sample size is at least moderate.

研究の動機と目的

  • p値やベイズ因子の限界を克服し、解釈可能で単純な帰無仮説を支持する統計的証拠の尺度を開発すること。
  • ミニマックス最適で事前分布を要しない手法を導入することで、多重比較における誤った証拠の問題を解決すること。
  • 小さな標本サイズ下でも、他の比較からの偶然の情報が使用された場合に、尺度が頑健に保たれることを保証すること。
  • p値や後確率とは異なり、比較の数に大きく依存しない一貫した証拠の解釈を提供すること。
  • 科学者がデータが対立仮説、帰無仮説、または両者を強く支持するかどうかを信頼できる客観的ツールで評価できるようにすること。

提案手法

  • 識別情報(DI)は、対立仮説と帰無仮説の下での正規化最大尤度(NML)値の比の対数として定義される。
  • NMLペナルティ尤度はミニマックス最適性を保証し、未観測の結果の平均化を回避するため、頻度主義的で頑健な手法となる。
  • 重み付き尤度アプローチにより、未加重NMLが定義されないモデルに対してもNMLフレームワークを拡張し、他の比較からの補助情報や帰無仮説を1観測値分の重みとして用いる。
  • 他の比較からの偶然の情報(例:他のタンパク質のデータ)は、1観測値分の重みとして割り当てられ、安定性と頑健性が保証される。
  • 簡略化された尤度モデルを用いることで、標本サイズや比較の数に関係なく解釈可能性と一貫性を維持する。
  • 理論的性質は漸近的解析により検証され、標本サイズが増加するにつれて誤った証拠の確率が0に収束することが示された。

実験結果

リサーチクエスチョン

  • RQ1事前分布を要しない証拠の尺度を開発でき、単純な帰無仮説を支持し、p値の欠陥を回避できるか?
  • RQ2他の比較からの偶然の情報の組み込みに対して、証拠の尺度がどのように頑健に保たれるか?
  • RQ3提案手法により、従来の多重比較補正の必要性が低減されるか?
  • RQ4識別情報(DI)は、対立仮説だけでなく、帰無仮説に対する強い証拠を信頼性高く示せるか?
  • RQ5最小限の偶然の情報を使用する小さな標本サイズ下で、この手法はどの程度の性能を示すか?

主な発見

  • 識別情報(DI)は漸近的に解釈可能であり、標本サイズが増加するにつれて誤った証拠の確率が0に収束する。
  • p値とは異なり、DIは単純な帰無仮説に対する強い証拠を示すことができ、古典的有意性検定の主要な限界を解消する。
  • この手法はミニマックス最適であり、未観測の結果の平均化を必要としないため、頻度主義的文脈下でベイズ因子よりも頑健である。
  • 帰無仮説を1観測値分の重みとして用いる場合、非常に小さな標本サイズ(グループごとにn=2)でも、他の比較からの偶然データを用いた場合とDI値が視覚的に区別できない。
  • n=4(グループあたり)の20タンパク質のケーススタディでは、帰無仮説を重みとする手法と偶然データを重みとする手法との間で、唯一のタンパク質の証拠グレードが変化したにとどまり、非常に高い頑健性を示した。
  • 最適情報を利用した場合、推定の後悔は一定であり、最大尤度推定とは異なり、標本平均の変動に依存しない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。