[論文レビュー] Kernel Partial Correlation Coefficient -- a Measure of Conditional Dependence
本稿では、再生核ヒルベルト空間(RKHS)を用いて、確率変数 $Y$ と $Z$ の間の条件付き依存度を非パラメトリックに測るためのカーネル部分相関係数(KPC)を導入する。$Y \perp\!\!\!\perp Z|X$ のときには 0 をとり、$Y$ が $Z$ と $X$ の可測関数であるときには 1 をとる。これは古典的相関係数の一般化である。著者らは、幾何的グラフに基づくおよびクロス・コバリアンス作用素に基づく2つの一貫性のある推定手法を提案し、$p \gg n$ であっても、モデルフリーで高次元の非線形変数選択が可能になる。推定は内部次元に適応し、特定の推定器のサブクラスでは近似的線形時間 $O(n\log n)$ で実行可能である。
In this paper we propose and study a class of simple, nonparametric, yet interpretable measures of conditional dependence between two random variables $Y$ and $Z$ given a third variable $X$, all taking values in general topological spaces. The population version of any of these measures captures the strength of conditional dependence and it is 0 if and only if $Y$ and $Z$ are conditionally independent given $X$, and 1 if and only if $Y$ is a measurable function of $Z$ and $X$. Thus, our measure -- which we call kernel partial correlation (KPC) coefficient -- can be thought of as a nonparametric generalization of the partial correlation coefficient that possesses the above properties when $(X,Y,Z)$ is jointly normal. We describe two consistent methods of estimating KPC. Our first method utilizes the general framework of geometric graphs, including $K$-nearest neighbor graphs and minimum spanning trees. A sub-class of these estimators can be computed in near linear time and converges at a rate that automatically adapts to the intrinsic dimension(s) of the underlying distribution(s). Our second strategy involves direct estimation of conditional mean embeddings using cross-covariance operators in the reproducing kernel Hilbert spaces. Using these empirical measures we develop forward stepwise (high-dimensional) nonlinear variable selection algorithms. We show that our algorithm, using the graph-based estimator, yields a provably consistent model-free variable selection procedure, even in the high-dimensional regime when the number of covariates grows exponentially with the sample size, under suitable sparsity assumptions. Extensive simulation and real-data examples illustrate the superior performance of our methods compared to existing procedures. The recent conditional dependence measure proposed by Azadkia and Chatterjee (2019) can be viewed as a special case of our general framework.
研究の動機と目的
- ガウス分布の仮定を超えて、古典的偏相関係数を一般化する非パラメトリックで解釈可能な、$X$ を与えたときの $Y$ と $Z$ の間の条件付き依存度の測度を構築すること。
- 測度が $Y$ と $Z$ が $X$ を与えたときに条件付き独立である場合にかつその場合にのみ 0 であり、$Y$ が $Z$ と $X$ の可測関数である場合にかつその場合にのみ 1 であることを保証すること。
- 一般の位相空間上で定義され、$p$ が $n$ に対して指数関数的に増加する高次元設定でも動作する、一貫性があり適応的なKPC係数推定器を設計すること。
- KPC推定器に基づくモデルフリーで非線形な変数選択アルゴリズムを構築し、スパarsity仮定のもとで一貫性を保つこと。
提案手法
- KPC係数は、再生核ヒルベルト空間(RKHS)理論を用いて、条件付き分布 $P_{Y|XZ}$ と $P_{Y|X}$ 間の期待最大平均差分(MMD)の比、および周辺分布 $P_Y$ と $P_{Y|X}$ 間のMMDの比として定義される。
- 幾何的グラフに基づく推定器は、$K$-近傍グラフや最小スパニングツリーを用いて、近似的線形時間 $O(n\log n)$ でKPC係数を推定し、データの内部次元に適応する。
- 2番目の推定器は、RKHSにおけるクロス・コバリアンス作用素を用いて、条件付き平均埋め込みを直接推定する。これにより、非パラメトリック推論のためのカーネル法が活用される。
- 両推定器の理論的一貫性は、有界性および特徴的カーネル仮定を含む弱い正則性条件のもとで確立されている。
- グラフベースのKPC推定器を用いた前向きステップワイズ変数選択アルゴリズムが開発され、高次元的状況下でも一貫性が保証されている。
- フレームワークは、データ分布の内部次元に自動的に適応し、低次元多様体上では収束速度が向上する。
実験結果
リサーチクエスチョン
- RQ1ガウス分布の仮定を超えて、古典的偏相関係数を一般化する非パラメトリックな条件付き依存度測度を構築できるか?
- RQ2提案された測度が、$Y \perp\!\!\!\perp Z|X$ ならばかつその場合にのみ 0 であり、$Y$ が $Z$ と $X$ の可測関数であるならばかつその場合にのみ 1 であるという重要な性質を満たすか?
- RQ3数多くの共変量が標本サイズ $n$ に対して指数関数的に増加する場合でも、収束する一貫性があり適応的な測度推定器を構築できるか?
- RQ4この測度に基づいて、モデルフリーで非線形な変数選択アルゴリズムを構築でき、高次元的状況下でも一貫性を保つことができるか?
主な発見
- 一般の位相空間上でも、$Y$ と $Z$ が $X$ を与えたときに条件付き独立であるときにはKPC係数は正確に 0 になり、$Y$ が $Z$ と $X$ の可測関数であるときには正確に 1 になる。
- 幾何的グラフベースの推定器は一貫性を示し、近似的線形時間 $O(n\log n)$ で計算可能であり、データの内部次元に適応する収束速度を持つ。
- クロス・コバリアンス作用素に基づく推定器は、条件付き平均埋め込みを直接推定する方法を提供し、高次元設定下での非線形変数選択を可能にする。
- グラフベースのKPC推定器を用いた前向きステップワイズ変数選択アルゴリズムは、共変量数が標本サイズ $n$ に対して指数関数的に増加する場合でも、スパarsity仮定のもとで一貫性が保証されている。
- この手法は、元の分布の内部次元に適応し、低次元多様体上では推定効率が向上する。
- KPCフレームワークは、最近のアザドキアとチャタージーの測度を特別な場合として含み、既存のアプローチを共通の非パラメトリックな条件付き依存度枠組みで統一する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。