Skip to main content
QUICK REVIEW

[論文レビュー] High-Dimensional Regularized Discriminant Analysis

John A. Ramey, Caleb K. Stein|arXiv (Cornell University)|Feb 3, 2016
Gene expression and cancer classification参考文献 40被引用数 3
ひとこと要約

本稿では、p > N の小標本・高次元データに対して計算的に効率的で解釈可能な分類器であるハイパラメータ正則化線形判別分析(HDRDA)を提案する。RDAを再パrameter化し、訓練観測値をクラス共分散推定値にプールし、ヌル空間の除去によって次元削減を行うことで、HDRDAはpに関して線形計算量を達成し、RDAや他の分類器よりも精度と速度で優れる。p=5000の特徴量において最大502.786倍の高速化を達成した。

ABSTRACT

Regularized discriminant analysis (RDA), proposed by Friedman (1989), is a widely popular classifier that lacks interpretability and is impractical for high-dimensional data sets. Here, we present an interpretable and computationally efficient classifier called high-dimensional RDA (HDRDA), designed for the small-sample, high-dimensional setting. For HDRDA, we show that each training observation, regardless of class, contributes to the class covariance matrix, resulting in an interpretable estimator that borrows from the pooled sample covariance matrix. Moreover, we show that HDRDA is equivalent to a classifier in a reduced-feature space with dimension approximately equal to the training sample size. As a result, the matrix operations employed by HDRDA are computationally linear in the number of features, making the classifier well-suited for high-dimensional classification in practice. We demonstrate that HDRDA is often superior to several sparse and regularized classifiers in terms of classification accuracy with three artificial and six real high-dimensional data sets. Also, timing comparisons between our HDRDA implementation in the sparsediscrim R package and the standard RDA formulation in the klaR R package demonstrate that as the number of features increases, the computational runtime of HDRDA is drastically smaller than that of RDA.

研究の動機と目的

  • 高次元小標本設定(p > N)における従来の正則化線形判別分析(RDA)の計算不能性と解釈不能性を解決すること。
  • RDAの正則化の利点を維持しつつ、計算効率と訓練観測値が共分散推定にどのように寄与するかの明確な解釈性を実現する分類器の開発。
  • RDAにおける行列演算の次元を、共分散行列のヌル空間成分を除去することで低減させ、特徴量数pに関して線形時間計算を可能にすること。
  • 実データおよびシミュレートされた高次元データセットにおいて、HDRDAがRDA、スパース分類器、ランダムフォレストよりも優れた分類精度を達成することの実証。
  • sparsediscrim Rパッケージにおける効率的な実装を提供し、モデル選択において標準RDAに比べて著しい高速化を示すこと。

提案手法

  • 各クラスの共分散行列とプールドサンプル共分散行列を組み合わせたバイアス付き共分散推定器を用いてRDAを再パラメータ化し、各訓練観測値の寄与度の解釈可能性を実現する。
  • 正定値性と安定性を保証するため、得られたプールド推定器をスケール付き単位行列に収縮する。
  • プールド共分散行列のヌル空間における行列演算は分類に冗長であるため、次元削減を実行し、次元を概ね標本サイズqにまで低減する。
  • 特異値分解(SVD)を用いて、プールド共分散行列に存在するp−N個のゼロ固有値を特定・削除し、低次元空間に問題を縮小する。
  • 低次元空間においてHDRDAの意思決定ルールを定式化し、小さな非特異行列における逆行列および行列式の計算を可能にすることで、pに関して線形時間計算を実現する。
  • sparsediscrim Rパッケージを用いて、次元削減を活用した効率的なグリッドサーチと交差検証によるチューニングパラメータ探索を実装し、高速なモデル選択を可能にする。

実験結果

リサーチクエスチョン

  • RQ1高次元小標本設定(p > N)において、正則化線形判別分析分類器を解釈可能かつ計算的に効率的に行えるか。
  • RQ2標準RDAの定式化を次元削減およびヌル空間除去を施したアプローチに置き換えることで、分類精度を維持しつつ計算コストを著しく低減できるか。
  • RQ3実データおよびシミュレートされた高次元データセットにおいて、HDRDAの性能はRDA、ランダムフォレスト、および他のスパースまたは対角線分類器と比べてどの程度優れているか。
  • RQ4p > N の条件下で、既存の収縮推定器(例:Srivastava & Kubokawa, Rao & Mitra)がHDRDAフレームワーク下でも有効に機能するか。
  • RQ5HDRDAのモデル選択プロセスは、遺伝子発現データや画像データなどの大規模高次元データに実用的であるほどに十分に高速化可能か。

主な発見

  • p=5000のとき、HDRDAは標準RDAのモデル選択において平均24.933分から2.979秒に短縮され、502.786倍の高速化を達成した。
  • 6つの実高次元データセットおよび3つのシミュレートデータセットにおいて、HDRDAはRDA、ランダムフォレスト、および複数のスパース分類器(例:Pang, Tong, Witten)を常に上回る分類精度を示した。
  • HDRDAの意思決定ルールは、プールド共分散行列に存在する概ねp−N個のゼロ固有値の調整に対して不変であるため、ヌル空間演算が冗長であり安全に削除可能であることが確認された。
  • HDRDAは外れ値に対して頑健であり、数値的不安定性により他の分類器(例:Pang, Tong, Witten)が失敗する状況でも高い性能を維持した。
  • HDRDA分類器は、訓練標本サイズに概ね等しい次元の低次元特徴空間における分類器と等価であり、pに関して線形時間の行列演算を可能にした。
  • sparsediscrim RパッケージにおけるHDRDAの実装は、大規模高次元データに対して計算的に実用的であり、このような状況ではRDAに代わる実用的選択肢となった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。