Skip to main content
QUICK REVIEW

[論文レビュー] Combining individually valid and conditionally i.i.d. P-variables

Lutz Mattner|arXiv (Cornell University)|Aug 30, 2010
Algorithms and Data Compression参考文献 4被引用数 5
ひとこと要約

本稿では、データに関して条件付きi.i.i.d.である個別に有効なP変数を組み合わせる手法を提案する。順序統計量 $U_{k:n}$ を用いて有効な要約P変数を生成する。主な結果は、仮定のもとで $V = 1 \land \left(\frac{n}{k} U_{k:n}\right)$ が有効なP変数であるということであり、$f_{n,k}(u) \leq 1 \land \left(\frac{n}{k}u\right)$ はそのような増加関数の中で最小である。これは弱い依存性仮定の下で多重仮説検定に対してロバストで分布に依存しないアプローチを提供する。

ABSTRACT

For a given testing problem, let $U_1,...,U_n$ be individually valid and conditionally on the data i.i.d.\ P-variables (often called P-values). For example, the data could come in groups, and each $U_i$ could be based on subsampling just one datum from each group in order to satisfy an independence assumption under the hypothesis. The problem is then to deterministically combine the $U_i$ into a valid summary P-variable. Restricting here our attention to functions of a given order statistic $U_{k:n}$ of the $U_i$, we compute the function $f_{n,k}$ which is smallest among all increasing functions $f$ such that $f(U_{k:n})$ is always a valid P-variable under the stated assumptions. Since $f_{n,k}(u)\le 1\wedge (\frac {n}{k} u)$, with the right hand side being a good approximation for the left when $k$ is large, one may in particular always take the minimum of 1 and twice the left sample median of the given P-variables. We sketch the original application of the above in a recent study of associations between various primate species by Astaras et al.

研究の動機と目的

  • データに関して条件付きi.i.i.d.であるが、観測値がグループ内ですでに依存している場合に、個別に有効なP変数を組み合わせる課題に対処すること。
  • n個のこのようなP変数を1つの有効な要約P変数 $V$ に写像する決定的かつ置換不変な関数 $F$ を導出すること。
  • 順序統計量 $U_{k:n}$ の関数として、$f_{n,k}(U_{k:n})$ が有効なP変数であるような最小の増加関数 $f_{n,k}$ を特定すること。
  • 弱い依存性(例:時系列データのサブサンプリングやグループ化された観測)が生じる状況において、P値を組み合わせる実用的で理論的根拠のある手法を提供すること。

提案手法

  • 本手法は、k番目の順序統計量 $U_{k:n}$ の関数に焦点を当て、$U_i$ が個別に有効で、データに関して条件付きi.i.i.d.であると仮定する。
  • 関数 $f_{n,k}(u)$ は、与えられた仮定のもとで $f_{n,k}(U_{k:n})$ が有効なP変数であるような最小の増加関数として定義される。
  • 二項分布および順序統計量の性質、特に二項分布 $\mathrm{B}_{n,p}$ の累積分布関数を用いて解を導出する。
  • 測度論的議論を用いて、積測度と像測度を含む、不等式 $f_{n,k}(u) \leq 1 \land \left(\frac{n}{k}u\right)$ が確立される。
  • Pカーネルと像測度の概念を用いて、帰無仮説の下での要約P変数の有効性を形式化する。
  • 構成的証明により、$V = 1 \land \left(\frac{n}{k}U_{k:n}\right)$ が常に有効なP変数であることが示され、$U_{k:n}$ の関数としての同調クラスにおける最適性が裏付けられる。

実験結果

リサーチクエスチョン

  • RQ1 $U_1,\ldots,U_n$ が個別に有効で、データに関して条件付きi.i.i.d.であるとき、$f_{n,k}(U_{k:n})$ が有効なP変数であるような最小の増加関数 $f_{n,k}$ は何か?
  • RQ2グループ内依存性のような弱い依存性仮定の下でも、有効かつロバストな要約P変数を構築できるか?
  • RQ3kの選択が、組み合わせたP変数の検出力および保守性にどのように影響するか?
  • RQ4中央値のようなヒューリスティックな選択を超えて、kを原理的かつ合理的に選ぶ方法はあるか?
  • RQ5特定の統計モデルにおいて、単一の順序統計量に基づくものより優れた要約P変数は存在するか?

主な発見

  • 仮定のもとで、$f_{n,k}(u) \leq 1 \land \left(\frac{n}{k}u\right)$ は、$f_{n,k}(U_{k:n})$ が有効なP変数であるような最小の増加関数である。
  • 要約P変数 $V = 1 \land \left(\frac{n}{k}U_{k:n}\right)$ は常に有効であり、$k$ が大きいときには境界がタイトである。
  • $k = \left\lfloor \frac{n+1}{2} \right\rfloor$ の場合、$V$ は $U_i$ の左中央値のおよそ2倍に相当し、実用的なデフォルトとして提案される。
  • 像測度と二項尾確率を用いた測度論的議論により、$f_{n,k}$ の最適性が証明される。
  • 仮定は最小限に抑えられており、$U_i$ の個別有効性とデータに関しての条件付きi.i.i.d.構造のみを要する。
  • この手法はロバストで分布に依存せず、元のデータ生成過程にパラメトリックな仮定を必要としない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。