Skip to main content
QUICK REVIEW

[論文レビュー] Measuring support for a hypothesis about a random parameter without estimating its unknown prior

David R. Bickel|arXiv (Cornell University)|Dec 31, 2010
Gene expression and cancer classification参考文献 43被引用数 8
ひとこと要約

この論文は、未知の事前分布の推定を必要とせずに、確率的パラメータに関する仮説の統計的支援を測定する手法を提案する。情報理論に基づくミニマックス最適な測度——特に正規化最大尤度(NML)に基づくアプローチ——を用いることで、事後分布と事前分布の対数オッズの差を漸近的に不偏に推定できることを示し、例えばプロテオミクスにおける単一のタンパク質のデータのような限られたデータでも強力な性能を発揮することを実証する。

ABSTRACT

For frequentist settings in which parameter randomness represents variability rather than uncertainty, the ideal measure of the support for one hypothesis over another is the difference in the posterior and prior log odds. For situations in which the prior distribution cannot be accurately estimated, that ideal support may be replaced by another measure of support, which may be any predictor of the ideal support that, on a per-observation basis, is asymptotically unbiased. Two qualifying measures of support are defined. The first is minimax optimal with respect to the population and is equivalent to a particular Bayes factor. The second is worst-sample minimax optimal and is equivalent to the normalized maximum likelihood. It has been extended by likelihood weights for compatibility with more general models. One such model is that of two independent normal samples, the standard setting for gene expression microarray data analysis. Applying that model to proteomics data indicates that support computed from data for a single protein can closely approximate the estimated difference in posterior and prior odds that would be available with the data for 20 proteins. This suggests the applicability of random-parameter models to other situations in which the parameter distribution cannot be reliably estimated.

研究の動機と目的

  • 未知の事前分布の推定を必要としない、確率的パラメータに関する仮説の統計的支援の測定法を開発すること。
  • 標本数が少なく、または相関関係があるような、遺伝子発現やプロテオミクスなどの高次元生物学的データにおいて、信頼性の高い事前分布推定の課題に対処すること。
  • 漸近的に事後分布と事前分布の対数オッズの差を模倣する支援測度を提供し、ベイズ的推論と整合性を保ちながら解釈可能性を確保すること。
  • 主観的または誤った事前分布に依存しない、客観的で頻度主義に近い証拠の測定法を提供し、ベイズ因子の解釈可能性を維持すること。
  • 実プロテオミクスデータを用いて、特に単一のタンパク質のデータしか利用できない状況において、提案された支援測度の性能を、経験的ベイズのベンチマークと比較して評価すること。

提案手法

  • 支持を、標準的なベイズ的測度である事後分布と事前分布の対数オッズの差として定義するが、事前分布の知識を必要としない形で定式化する。
  • 2つのミニマックス最適な支援測度を導入する:1つは母集団に関してミニマックス最適であり、もう1つは最悪の標本に関してミニマックス最適である。
  • 最初の測度は特定のベイズ因子と等価であり、2番目の測度は一般モデルに拡張された正規化最大尤度(NML)と等価である。
  • NMLに基づく測度を、マイクロアレイやプロテオミクスデータ解析で一般的な2独立正規分布標本モデルに適用する。
  • 情報理論的原則(例:最小記述長)を用いて、観測ごとに漸近的に不偏となる支援測度を導出する。
  • 予測密度の積分を含むペナルティ項を用いて、特に高次元設定において過学習を防ぐ。

実験結果

リサーチクエスチョン

  • RQ1確率的パラメータの未知の事前分布の推定を必要としない、統計的支援の測定法を定義できるか?
  • RQ2事前分布の知識がなければ得られない状況において、漸近的に事後分布と事前分布の対数オッズの差を近似する形で仮説の支援をどのように定量化できるか?
  • RQ3このような支援測度がミニマックス基準においてどのような最適性を示し、最大尤度比や経験的ベイズ法といった既存手法と比べてどう異なるか?
  • RQ4単一のタンパク質のデータから計算された支援が、20個のタンパク質のデータから得られる事後分布と事前分布の対数オッズの差をどの程度正確に近似できるか?
  • RQ5高次元または小標本設定において、提案されたミニマックス支援は、上限(最大尤度比)に対してどのように性能を発揮するか?

主な発見

  • 正規化最大尤度(NML)に基づく支援測度は、最悪の標本に関してミニマックス最適であり、事前分布が未知であっても頑健に機能することが示された。
  • 単一のタンパク質に対しては、提案された支援測度が20個のタンパク質のデータから得られる事後分布と事前分布の対数オッズの差を非常によく近似する。
  • NMLに基づく支援測度は、最大尤度比(上界)よりも過学習を抑え、証拠を過大評価する傾向が少ない。
  • ミニマックス支援測度は、高次元設定においても真の事後分布と事前分布の対数オッズの差を超過せず、保守的である。
  • 標本数が少ない、または相関のある特徴があるようなプロテオミクスのような分野で、経験的ベイズ事前分布を信頼性を持って推定できないモデルにも適用可能である。
  • 支援測度は、キャリブレーションを必要とせず、あらゆる標本サイズで解釈可能であり、事前から事後へのオッズの変化を直接測定するため、ベイズ的解釈と整合的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。