Skip to main content
QUICK REVIEW

[論文レビュー] Sliced Mutual Information: A Scalable Measure of Statistical Dependence

Ziv Goldfeld, Kristjan Greenewald|arXiv (Cornell University)|Oct 11, 2021
Neural Networks and Applications参考文献 34被引用数 9
ひとこと要約

本稿では、高次元変数の1次元投影における相互情報量の平均として定義されるスライスド相互情報量(SMI)を提案する。SMIは古典的相互情報量(MI)のスケーラブルな代替手段であり、特徴抽出や表現学習の分野で高次元設定において有用である。SMIは古典的MIが持つ重要な性質を保ちつつ、効率的な推定が可能であり、決定的変換によって依存度を向上させられる。

ABSTRACT

Mutual information (MI) is a fundamental measure of statistical dependence, with a myriad of applications to information theory, statistics, and machine learning. While it possesses many desirable structural properties, the estimation of high-dimensional MI from samples suffers from the curse of dimensionality. Motivated by statistical scalability to high dimensions, this paper proposes sliced MI (SMI) as a surrogate measure of dependence. SMI is defined as an average of MI terms between one-dimensional random projections. We show that it preserves many of the structural properties of classic MI, while gaining scalable computation and efficient estimation from samples. Furthermore, and in contrast to classic MI, SMI can grow as a result of deterministic transformations. This enables leveraging SMI for feature extraction by optimizing it over processing functions of raw data to identify useful representations thereof. Our theory is supported by numerical studies of independence testing and feature extraction, which demonstrate the potential gains SMI offers over classic MI for high-dimensional inference.

研究の動機と目的

  • 高次元サンプルからの相互情報量(MI)推定における次元の呪いを緩和すること。
  • 古典的MIが持つ望ましい構造的性質を保ちつつ、スケーラブルな統計的依存度の代理測度を開発すること。
  • 高次元データにおける依存度の効率的推定と最適化を可能にし、特に表現学習に応用すること。
  • 古典的MIとは異なり、SMIが決定的変換によって増加可能であることを示し、特徴抽出への応用を可能にすること。

提案手法

  • SMIは、高次元球面上のランダムな単位ベクトルを用いて、確率的変数XとYの1次元投影間のMIの平均として定義される。
  • SMIにおける積分を近似するために、単位球面上のモンテカルロサンプリングを活用し、有限サンプルからの経験的推定を可能にする。
  • SMIの双対形式を近似するためのニューラルネットワークを用いた変分推定器、S-MINEを提案する。
  • 線形または非線形変換のエンドツーエンド最適化が可能となり、特徴抽出を促進する。
  • 理論的分析により、推定誤差がm^{-1/2} + n^{-1/2}(対数要因を除いて)に比例することが示され、高次元においてほぼパラメトリックレートを達成する。
  • 合成データおよびMNISTデータセットを用いた独立性検定と特徴抽出の実験により、古典的MIよりも優れた性能を示した。

実験結果

リサーチクエスチョン

  • RQ1高次元設定においても統計的に効率的であるような、相互情報量の代理測度を構築可能か?
  • RQ2SMIは、独立性の下でゼロとなる性質や変分表現といった、古典的MIの主要な構造的性質を保持するか?
  • RQ3決定的変換によってSMIが増加可能であり、古典的MIとは異なり、その性質を特徴抽出に応用可能か?
  • RQ4モンテカルロサンプリングおよびニューラル推定器を用いたSMI推定の統計的収束速度はどのようになるか?
  • RQ5独立性検定や表現学習といった実用的タスクにおいて、SMIは古典的MIに比べてどのように性能を発揮するか?

主な発見

  • SMIは統計的推定誤差がm^{-1/2} + n^{-1/2}(対数要因を除いて)に比例することを示し、高次元においてほぼパラメトリック収束を達成する。
  • SMIは、線形投影などの決定的変換によって増加可能であり、特徴抽出の目的関数としての応用が可能である。
  • ガウス分布データセットにおいて、S-MINEは理論的期待に一致する真の方向(e1)を最適な投影として正しく回復した。
  • MNISTの0-1クラス設定において、SMI最適化により0.680ビットの推定SMIが達成され、ランダム投影による0.0752に比べ顕著に高い値を示した。
  • XとYが独立に生成された場合(クラス共有なし)、推定SMIは0.0289に低下し、依存性の検出が正しく行われたことが確認された。
  • 学習された変換行列のヒートマップは、数字の'0'に類似しており、SMI最適化がクラス関連の特徴を効果的に抽出したことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。