Skip to main content
QUICK REVIEW

[論文レビュー] CCMI : Classifier based Conditional Mutual Information Estimation

Sudipto Mukherjee, Himanshu Asnani|arXiv (Cornell University)|Jun 5, 2019
Neural Networks and Applications参考文献 46被引用数 20
ひとこと要約

本稿では、KLダイバージェンスを推定するための判別モデルを活用する新しい分類器ベースの条件付き相互情報量推定手法CCMIを提案する。この手法により、結合分布と積分布の間のKLダイバージェンスを推定でき、高次元設定下でも高精度なCMI推定が可能になる。k-NN法やカーネルベースの手法とは異なり、CCMIは次元の呪いを回避し、条件付き独立性検定において最先端の性能を発揮する。100次元の条件下でもAUC > 0.91を維持し、合成データおよび実世界のフローサイトメトリーデータにおいてCCITを上回る性能を示した。

ABSTRACT

Conditional Mutual Information (CMI) is a measure of conditional dependence between random variables X and Y, given another random variable Z. It can be used to quantify conditional dependence among variables in many data-driven inference problems such as graphical models, causal learning, feature selection and time-series analysis. While k-nearest neighbor (kNN) based estimators as well as kernel-based methods have been widely used for CMI estimation, they suffer severely from the curse of dimensionality. In this paper, we leverage advances in classifiers and generative models to design methods for CMI estimation. Specifically, we introduce an estimator for KL-Divergence based on the likelihood ratio by training a classifier to distinguish the observed joint distribution from the product distribution. We then show how to construct several CMI estimators using this basic divergence estimator by drawing ideas from conditional generative models. We demonstrate that the estimates from our proposed approaches do not degrade in performance with increasing dimension and obtain significant improvement over the widely used KSG estimator. Finally, as an application of accurate CMI estimation, we use our best estimator for conditional independence testing and achieve superior performance than the state-of-the-art tester on both simulated and real data-sets.

研究の動機と目的

  • k-NN法やカーネルベースの手法に見られる、既存の条件付き相互情報量(CMI)推定手法における次元の呪いを解消すること。
  • 従来の手法が劣化する高次元設定下でも、正確かつ安定したCMI推定フレームワークを構築すること。
  • 分類器および生成モデルの進展を活用して、より標本効率的かつスケーラブルなCMI推定手法の新クラスを創出すること。
  • 条件付き独立性検定を通じて、正確なCMI推定の実用的価値を示し、最先端の手法を上回ること。

提案手法

  • 真の結合分布と条件付き分布の積を区別するように訓練された分類器に基づく、新たなKLダイバージェンス推定手法を提案。尤度比を代理指標として用いる。
  • 条件付き生成モデルの原則を応用して、基本的なダイバージェンス推定器を拡張し、複数のCMI推定器を構築する。
  • 直接的な密度推定を回避するため、観測分布と因子化された分布の間のダイバージェンスを推定するために二標本分類器アプローチを採用する。
  • 結合分布と積分布からのペアドデータを用いてニューラルネットワーク分類器を訓練し、対数尤度比を介してダイバージェンスを推定する。
  • 推定値をゼロで閾値処理することで、条件付き独立性検定に結果として得られたCMI推定器を適用し、AUROCを用いて性能を評価する。
  • 仮説検定にはパーミュテーションベースのp値推定を用いるが、報告される主な指標はAUROCである。

実験結果

リサーチクエスチョン

  • RQ1分類器ベースのアプローチは、高次元設定下での条件付き相互情報量推定において、k-NN法やカーネルベースの手法を上回ることができるか?
  • RQ2条件変数Zの次元が増加するに従い、提案されたCCMI推定器は正確性と安定性を維持できるか?
  • RQ3合成データおよび実世界のデータにおいて、CCITと比較してCCMIは条件付き独立性検定で優れた性能を発揮できるか?
  • RQ4標本数が限られている、例えば生物学的データセットのような状況下で、CCMIの性能は劣化するか、それとも頑健性を保つのか?

主な発見

  • CCMIは条件付き独立性検定において高い性能を維持し、条件変数Zの次元が100に達しても平均AUROCが0.91を達成した。一方、CCITは50次元を超えると著しく性能を低下させた。
  • ポストノンラインノイズを含む合成データにおいて、d_z = 100の条件下で、条件付き独立なペアと依存なペアのCMI推定値に明確な分離が見られ、閾値を0に設定した際の正確度(precision)は0.84、再現率(recall)は0.86を示した。
  • 853件のサンプルしかなく、d_z ∈ {5,7}の実際のフローサイトメトリーデータにおいても、CCMIはCCITを上回るAUROCを達成し、低サンプル数・中程度次元の設定下でも頑健性を示した。
  • 提案された分類器ベースのKLダイバージェンス推定器は、最近のニューラル手法よりも安定性に優れ、CCMIフレームワークの基盤を形成している。
  • k-NN法が指数的標本必要量に苦しむ高次元領域において、CCMIは広く用いられているKSG推定器を著しく上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。