Skip to main content
QUICK REVIEW

[論文レビュー] Maximally Correlated Principal Component Analysis

Soheil Feizi, David Tse|arXiv (Cornell University)|Feb 17, 2017
Blind Source Separation Techniques参考文献 26被引用数 8
ひとこと要約

本稿では、特徴量の非線形変換を最適化して得られる共分散行列のKy Fanノルムを最大化することでPCAを一般化する非線形次元削減手法、最大相関主成分分析(MCPCA)を提案する。MCPCAは、合成データおよび実データの両方でPCAや最先端手法を上回り、非線形的およびカテゴリカルな依存関係を捉える点で優れる。

ABSTRACT

In the era of big data, reducing data dimensionality is critical in many areas of science. Widely used Principal Component Analysis (PCA) addresses this problem by computing a low dimensional data embedding that maximally explain variance of the data. However, PCA has two major weaknesses. Firstly, it only considers linear correlations among variables (features), and secondly it is not suitable for categorical data. We resolve these issues by proposing Maximally Correlated Principal Component Analysis (MCPCA). MCPCA computes transformations of variables whose covariance matrix has the largest Ky Fan norm. Variable transformations are unknown, can be nonlinear and are computed in an optimization. MCPCA can also be viewed as a multivariate extension of Maximal Correlation. For jointly Gaussian variables we show that the covariance matrix corresponding to the identity (or the negative of the identity) transformations majorizes covariance matrices of non-identity functions. Using this result we characterize global MCPCA optimizers for nonlinear functions of jointly Gaussian variables for every rank constraint. For categorical variables we characterize global MCPCA optimizers for the rank one constraint based on the leading eigenvector of a matrix computed using pairwise joint distributions. For a general rank constraint we propose a block coordinate descend algorithm and show its convergence to stationary points of the MCPCA optimization. We compare MCPCA with PCA and other state-of-the-art dimensionality reduction methods including Isomap, LLE, multilayer autoencoders (neural networks), kernel PCA, probabilistic PCA and diffusion maps on several synthetic and real datasets. We show that MCPCA consistently provides improved performance compared to other methods.

研究の動機と目的

  • PCAが非線形相関を捉えることやカテゴリカル変数を扱うことの限界を解消すること。
  • 次元削減に適した、最大相関の多次元拡張を開発すること。
  • 同時正規分布およびカテゴリカル変数を前提としたMCPCA最適化のグローバル最適解を同定すること。
  • 一般のカテゴリカルデータに対して収束保証があるブロック座標降下法を提案すること。
  • 多様なデータセット上でMCPCAのPCAおよび他のSOTA手法に対する優位性を実証的に検証すること。

提案手法

  • MCPCAは、特徴量 $\phi_i(X_i)$ の非線形変換を最適化し、変換後の共分散行列 $\mathbf{K}_{\phi(X)}$ の上位 $q$ 個の固有値の和(Ky Fanノルム)を最大化する。
  • 各変換変数について、ゼロ平均および単位分散の制約が課される:$\mathbb{E}[\phi_i(X_i)] = 0$、$\mathbb{E}[\phi_i(X_i)^2] = 1$。
  • 同時正規分布変数の場合、ランク制約下でグローバル最適解は恒等変換または負の恒等変換として特定される。
  • ランク1のカテゴリカル変数の場合、グローバル最適解は、対ごとの同時分布から構築された行列の最大固有ベクトルから導出される。
  • 一般のランク制約に対しては、ブロック座標降下法が提案され、最適化の停留点への収束が証明されている。
  • 本手法は二重交差検証を用いて適用され、学習された変換がテストデータに適用され、PCA、Isomap、LLE、カーネルPCA、オートエンコーダー、拡散マップと比較された。

実験結果

リサーチクエスチョン

  • RQ1最大相関の多次元拡張は、データの非線形的およびカテゴリカルな依存関係をPCAよりも効果的に捉えることができるか?
  • RQ2同時正規分布およびカテゴリカル変数を前提としたMCPCA最適化のグローバル最適解は何か?
  • RQ3MCPCAは、実データおよび合成データ上で最先端の次元削減手法と比較してどのように性能を発揮するか?
  • RQ4ホールドアウトデータ上でMCPCAは性能を維持または向上させるか、過学習に対する耐性があると示唆されるか?
  • RQ5MCPCAが抽出する上位メタ特徴量は、下位の表型変数をどれほど予測可能か?

主な発見

  • MCPCAは、すべての $q$ 値において乳がんおよび成人収入データセットでPCAを著しく上回り、分散の説明を改善する。他のデータセットでも同等の性能を示す。
  • 表型との予測相関において、MCPCAは、バイナリ表型を有する5つのデータセットすべてで、カーネルPCAやオートエンコーダーを含む他のすべての手法よりも高い相関を達成する。
  • 連続的およびカテゴリカルなデータの両方で、MCPCAは頑健な性能を示し、実験では失敗事例が一切なく、LLEとは異なりクラッシュしなかった。
  • 同時正規分布変数の場合、MCPCAのグローバル最適解は、ランク制約下で恒等変換または負の恒等変換として示された。
  • カテゴリカルデータ向けのブロック座標降下法は、MCPCA最適化の停留点に収束することが確認された。
  • MCPCAはホールドアウトデータセットでも優れた性能を示し、効果的な一般化および意味のある非線形相関の捉え込みを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。