Skip to main content
QUICK REVIEW

[論文レビュー] Spectral feature scaling method for supervised dimensionality reduction

Momo Matsuda, Keiichi Morikuni|arXiv (Cornell University)|May 18, 2018
Face and Expression Recognition参考文献 20被引用数 3
ひとこと要約

本論文は、ラベル付き部分データから最適な特徴スケーリング係数を学習することで、クラスタリングおよび分類性能を向上させる、スペクトル特徴スケーリングを用いた教師あり次元削減手法を提案する。Fiedler ベクトルと線形行列パencil を用いて一般化固有値問題を定式化することで、特徴を適応的に再スケーリングし、低次元空間における分離性を向上させる。合成データおよび実世界の遺伝子発現データセットにおいて、従来手法を上回り、特に高次元・小標本の状況下でも優れた性能を示す。

ABSTRACT

Spectral dimensionality reduction methods enable linear separations of complex data with high-dimensional features in a reduced space. However, these methods do not always give the desired results due to irregularities or uncertainties of the data. Thus, we consider aggressively modifying the scales of the features to obtain the desired classification. Using prior knowledge on the labels of partial samples to specify the Fiedler vector, we formulate an eigenvalue problem of a linear matrix pencil whose eigenvector has the feature scaling factors. The resulting factors can modify the features of entire samples to form clusters in the reduced space, according to the known labels. In this study, we propose new dimensionality reduction methods supervised using the feature scaling associated with the spectral clustering. Numerical experiments show that the proposed methods outperform well-established supervised methods for toy problems with more samples than features, and are more robust regarding clustering than existing methods. Also, the proposed methods outperform existing methods regarding classification for real-world problems with more features than samples of gene expression profiles of cancer diseases. Furthermore, the feature scaling tends to improve the clustering and classification accuracies of existing unsupervised methods, as the proportion of training data increases.

研究の動機と目的

  • 特徴の不規則さや不確実性による高次元データにおけるクラスタリング性能の低さという課題に対処すること。
  • 部分ラベル情報を利用して特徴スケーリング係数を学習することで、スペクトルクラスタリングおよび分類性能を向上させること。
  • 低次元空間における線形分離性を、適応的特徴スケーリングを通じて向上させる教師あり手法を開発すること。
  • トピックモデルや実世界の遺伝子発現データセットにおいて、従来手法に対するロバスト性と優位性を示すこと。

提案手法

  • 本手法は、線形行列パencil を含む一般化固有値問題を定式化し、固有ベクトルが特徴スケーリング係数を表す。
  • 部分サンプルラベルの事前知識を用いて Fiedler ベクトルを指定し、目的のクラスタ構造に向けたスケーリングプロセスをガイドする。
  • 特徴スケーリングはすべてのサンプルに適用され、分散および平均が変更され、低次元空間における分離性が向上する。
  • Laplacian eigenmap を適用する前に特徴を変換することで、スペクトルクラスタリングと統合され、より良いクラスタ形成が可能になる。
  • 遺伝子発現解析に一般的な高次元・小標本設定においてもロバストであるように設計されている。
  • LPP や LFDA などの既存の非教師あり手法を強化するための前処理ステップとしても適用可能である。

実験結果

リサーチクエスチョン

  • RQ1部分ラベル情報に基づく特徴スケーリングは、高次元データにおけるスペクトルクラスタリング性能を向上させることができるか?
  • RQ2従来の教師あり次元削減手法と比較して、特徴スケーリングによる教師あり特徴スケーリングは、クラスタリングおよび分類精度においてどのように異なるか?
  • RQ3特徴スケーリングは、サンプル数が特徴数を上回らない実世界の遺伝子発現データセットにおいて、次元削減のロバスト性をどの程度向上させるか?
  • RQ4学習されたスケーリング係数を組み合わせることで、非教師ありスペクトルクラスタリングの性能は向上するか?
  • RQ5ラベル付き学習データの割合が増加するに従い、本手法は性能を維持または向上させるか?

主な発見

  • 特徴数がサンプル数を上回らないトピックモデルでは、本手法が既存の教師あり手法を上回るクラスタリングおよび分類精度を達成した。
  • 実世界の遺伝子発現データセット(例:卵巣がん、膵がん、IPF、大腸がん)において、本手法は既存手法よりも高いランダムインデックス(RI)および正規化相互情報量(NMI)スコアを達成した。
  • IPF データセットでは、SC-S が RI 76.1% ± 0.00 および NMI 0.093 ± 0.000 を達成し、ベースライン手法を顕著に上回った。
  • 分類タスクでは、IPF データセットで SC-S が 97.4% ± 4.43 の精度を達成し、KLFDA や LFDA を含む他の手法を上回った。
  • 特にラベル付き学習データの割合が増加する際、クラスタリングにおけるロバスト性が向上した。
  • LPP や LFDA などの既存の非教師あり手法の性能は、特徴スケーリングによって一貫して向上し、特に高次元設定下で顕著であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。