Skip to main content
QUICK REVIEW

[論文レビュー] Kernel Stein Tests for Multiple Model Comparison

Jen Ning Lim, Makoto Yamada|arXiv (Cornell University)|Oct 27, 2019
Statistical Methods and Bayesian Inference被引用数 7
ひとこと要約

本稿では、$ l > 2 $ 個の候補モデルから最良のモデルを選択する際、整合的誤検出率(FPR)と整合的発見率(FDR)をそれぞれ制御する2つのノンパラメトリックな統計的検定、RelPSI と RelMulti を提案する。カーネルベースの乖離度(MMD または KSD)を用い、選択バイアスを事後選択推論または多重補正によって補正することで、誤り率が良好に制御された高精度な真陽性率を達成し、原始的な乖離スコアに基づく単純な選択手法を上回る性能を発揮する。

ABSTRACT

We address the problem of non-parametric multiple model comparison: given $l$ candidate models, decide whether each candidate is as good as the best one(s) or worse than it. We propose two statistical tests, each controlling a different notion of decision errors. The first test, building on the post selection inference framework, provably controls the number of best models that are wrongly declared worse (false positive rate). The second test is based on multiple correction, and controls the proportion of the models declared worse but are in fact as good as the best (false discovery rate). We prove that under appropriate conditions the first test can yield a higher true positive rate than the second. Experimental results on toy and real (CelebA, Chicago Crime data) problems show that the two tests have high true positive rates with well-controlled error rates. By contrast, the naive approach of choosing the model with the lowest score without correction leads to more false positives.

研究の動機と目的

  • 複数の候補モデル($ l > 2 $)が存在する非パラメトリックな複数モデル比較の課題に対処すること。
  • データに基づいて参照モデル(最良モデル)が選択されることに起因する選択バイアスの影響を受ける中で、特に偽陽性と偽発見の決定誤差を制御すること。
  • MMD や KSD といったカーネルベースの乖離度を用いて、相対的適合検定を二項比較(例:RelMMD)から複数モデルへの拡張すること。
  • 参照モデルがデータに基づいて選択されるという選択バイアスの下で、誤り率の理論的保証を提供すること。
  • 提案手法が多様な合成データおよび実世界のデータセットにおいて、誤り率を良好に制御しながら高い統計的パワーを維持することを経験的に検証すること。

提案手法

  • モデルの乖離度推定値(MMD または KSD)が最小となるモデルを参照モデルとして選択し、他のモデルとの比較の基準とする。
  • 各 $ l $ 個のモデルに対して、そのモデルと参照モデルとの乖離度の差を相対統計量として計算する。
  • RelPSI は事後選択推論を用いて偽陽性率(FPR)を制御し、誤って最良モデルを劣悪と判断する確率が上限に抑えられることを保証する。
  • RelMulti は多重補正(例:Benjamini-Hochberg)を適用して偽発見率(FDR)を制御し、最良モデルより劣ると誤って特定されるモデルの割合を制御する。
  • MMD を用いる場合はサンプルで表現されるモデル、KSD を用いる場合は正規化されていない密度関数で表現されるモデルに対しても適用可能であり、広範な適用性を有する。
  • RelMulti-KSD の漸近的帰無分布を導出することで、妥当な推論が可能となり、$ l=2 $ の場合に二標本相対検定が特殊ケースとして回復されることを示す。

実験結果

リサーチクエスチョン

  • RQ1二項比較を超えて複数モデルへの相対的適合検定を拡張することは可能か? その際、統計的厳密性を維持できるか?
  • RQ2参照モデルがデータに基づいて選択されることに起因する選択バイアスの下で、偽陽性率(FPR)をどのように制御できるか?
  • RQ3偽発見率(FDR)を制御することで、家族ワイズ誤り率(FPR)を制御するのと比較して、より高い統計的パワーが得られるか?
  • RQ4どのような条件下で、事後選択推論(RelPSI)が多重補正(RelMulti)よりも高い真陽性率を達成するか?
  • RQ5提案手法は、原始的な乖離スコアに基づく単純なモデル選択手法と比較して、どのように経験的に性能を発揮するか?

主な発見

  • RelPSI は偽陽性率(FPR)を制御し、RelMulti は偽発見率(FDR)を制御するが、それぞれ適切な条件下で理論的保証が与えられている。
  • 混合正規分布問題では、RelPSI が RelMulti よりも一貫して高い真陽性率(TPR)を達成しており、定理 4.1 の理論的上限が裏付けられている。
  • RBM 実験では、KSD を用いた手法が最も高い TPR を達成しており、未正規化密度関数で表現されるモデルに対して KSD が有効であることが示された。
  • 平均シフト実験では、異なる摂動レベルに対しても、RelPSI と RelMulti が FPR と FDR を良好に制御しており、モデルの類似性に強く対応していることが確認された。
  • 原始的な手法(乖離スコアが最小のモデルを単純選択)では、顕著に偽陽性が増加しており、補正の必要性が強調された。
  • 経験的結果から、選択に 50% のデータ、検定に 50% のデータを割り当てた RelMulti は、FDR を良好に制御し、高い TPR を達成している。一方、選択により多くのデータを割り当てると、検定に割り当てられるデータが減り、パワーが低下することが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。