Skip to main content
QUICK REVIEW

[論文レビュー] Multi-view Unsupervised Feature Selection by Cross-diffused Matrix Alignment

Xiaokai Wei, Bokai Cao|arXiv (Cornell University)|May 2, 2017
Face and Expression Recognition参考文献 27被引用数 5
ひとこと要約

本稿では、クラスターラベルに基づく手法と比較して、複数のビューからより豊かな情報を保持するためのクロス拡散行列アライメントを用いる、新しい非教師ありマルチビュー特徴選択手法CDMA-FSを提案する。特徴選択を準ニュートン法で解く制約付き最適化問題として定式化することにより、真のラベルが存在しない状況でも、最先端の手法を上回るクラスタリング性能を達成する。

ABSTRACT

Multi-view high-dimensional data become increasingly popular in the big data era. Feature selection is a useful technique for alleviating the curse of dimensionality in multi-view learning. In this paper, we study unsupervised feature selection for multi-view data, as class labels are usually expensive to obtain. Traditional feature selection methods are mostly designed for single-view data and cannot fully exploit the rich information from multi-view data. Existing multi-view feature selection methods are usually based on noisy cluster labels which might not preserve sufficient information from multi-view data. To better utilize multi-view information, we propose a method, CDMA-FS, to select features for each view by performing alignment on a cross diffused matrix. We formulate it as a constrained optimization problem and solve it using Quasi-Newton based method. Experiments results on four real-world datasets show that the proposed method is more effective than the state-of-the-art methods in multi-view setting.

研究の動機と目的

  • ノイズの多いクラスターラベルに依存する既存の非教師ありマルチビュー特徴選択手法の限界を解消すること。
  • クロス拡散を用いて共通の類似性グラフを構築することで、複数のビューのデータ表現をより正確かつ情報豊かに保持する手法の開発。
  • 直接的にクロス拡散行列を用いた行列アライメントにより、分類ラベルに依存せずに効果的な特徴選択を実現すること。
  • 真のラベルが利用できない実世界の非教師ありシナリオにおける実用的導入を想定し、パラメータ設定のガイドラインを提供すること。

提案手法

  • 複数のビュー間で情報を統合するクロス拡散プロセスを用いて、クラスターラベルよりも洗練された構造的関係を保持する共通類似性グラフを構築する。
  • 選択された特徴行列をクロス拡散行列とアライメントさせる制約付き最適化問題として特徴選択を定式化し、データ構造を維持する。
  • 非線形かつ非凸な目的関数を効率的かつ安定に収束させるために、準ニュートン法に基づく最適化手法を用いる。
  • 各ビューの影響度を制御するための正則化パラメータαをクロス拡散プロセスに導入し、実験的ガイドラインを提供する。
  • 最適化の簡素化と解釈可能性の向上のため、拡散行列Wに0/1重み付け方式を適用する。
  • データポイントの単位長さ正規化を実施し、σ² = 1を固定することで、異なるデータセット間での拡散プロセスの安定化を図る。

実験結果

リサーチクエスチョン

  • RQ1非教師あり特徴選択において、クラスターラベルと比較してクロス拡散行列表現が、マルチビュー・データ構造をどれほど効果的に保持できるか?
  • RQ2クロス拡散行列との直接的な行列アライメントは、疑似ラベル誘導回帰と比較して、特徴選択性能をどのように向上させるか?
  • RQ3提案手法のハイパーパrameter α に対する感受性は何か?また、教師なし条件下で信頼性を持ってチューニング可能か?
  • RQ4パラメータを真のラベルなしでチューニングした場合でも、CDMA-FSは最先端の非教師ありマルチビュー特徴選択手法をクラスタリング精度およびNMIの観点から上回るか?
  • RQ5本手法は、特徴次元数やビュー構造が異なる多様な実世界データセットにおいても、安定した性能を維持できるか?

主な発見

  • BBCSportとBlogCatalogの両データセットにおいて、全特徴を使用する場合と比較して400特徴のみを用いた場合でも、クラスタリング精度がそれぞれ26%および15%向上した。
  • 4つの実世界データセットすべてにおいて、真のラベルを用いたパrameterチューニングを行わないにもかかわらず、最良のチューニング済みベースライン手法と同等またはそれ以上の性能を達成した。
  • 正則化パラメータαの選択に対して本手法は頑健であり、α > 10⁻⁵ の範囲で良好な性能を維持するが、ベースライン手法はパrameter値に極めて敏感である。
  • ベースライン手法の中央値性能は、最良性能に比べて著しく劣っており、ラベルなしでパrameterをチューニングする際の実用的限界を示している。CDMA-FSは、安定したラベルフリーのパrameter設定により、この課題を克服した。
  • クロス拡散行列アライメントの導入により、クラスターラベルベース手法と比較して、データ構造のより良い保持が可能となり、より情報豊かな特徴選択が実現した。
  • 提案手法は、高次元かつノイズの多いデータ(例:ソーシャルメディアやニュース記事)を含む多様なデータセットにおいても優れた汎化性能を示し、実用的有用性を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。