Skip to main content
QUICK REVIEW

[論文レビュー] Integrative Generalized Convex Clustering Optimization and Feature Selection for Mixed Multi-View Data

Minjie Wang, Genevera I. Allen|PubMed|Dec 11, 2019
Face and Expression Recognition参考文献 78被引用数 21
ひとこと要約

本稿では、混合マルチビュー・データにおける統合的クラスタリングおよび特徴選択のための凸最適化フレームワーク、iGecco+ を提案する。視覚固有の損失関数と結合融合ペナルティを用い、共通のサンプル群を同定する。スparserな特徴選択を可能にするための適応的シフト付きグループラッソペナルティと、一般化されたマルチブロックADMMアルゴリズムを導入し、高次元のゲノムおよびテキストデータにおいて優れたクラスタリング性能を達成する。

ABSTRACT

In mixed multi-view data, multiple sets of diverse features are measured on the same set of samples. By integrating all available data sources, we seek to discover common group structure among the samples that may be hidden in individualistic cluster analyses of a single data view. While several techniques for such integrative clustering have been explored, we propose and develop a convex formalization that enjoys strong empirical performance and inherits the mathematical properties of increasingly popular convex clustering methods. Specifically, our Integrative Generalized Convex Clustering Optimization (iGecco) method employs different convex distances, losses, or divergences for each of the different data views with a joint convex fusion penalty that leads to common groups. Additionally, integrating mixed multi-view data is often challenging when each data source is high-dimensional. To perform feature selection in such scenarios, we develop an adaptive shifted group-lasso penalty that selects features by shrinking them towards their loss-specific centers. Our so-called iGecco+ approach selects features from each data view that are best for determining the groups, often leading to improved integrative clustering. To solve our problem, we develop a new type of generalized multi-block ADMM algorithm using sub-problem approximations that more efficiently fits our model for big data sets. Through a series of numerical experiments and real data examples on text mining and genomics, we show that iGecco+ achieves superior empirical performance for high-dimensional mixed multi-view data.

研究の動機と目的

  • 同一のサンプルセット上で測定された異なるデータタイプ(連続値、カウント、カテゴリカル、割合)を対象としたクラスタリングの課題に取り組む。
  • 単一ビュークラスタリングの限界を克服し、複数のデータソースを統合することで、隠れた共通のグループ構造を特定する。
  • クラスタを区別する情報をもつ特徴を同定することで、高次元混合データにおける特徴選択を可能にする。
  • 大規模データセットにモデルを適合させる際に、グローバル最適解への収束を保証しながら、計算効率の高いアルゴリズムを開発する。

提案手法

  • 非正規分布および混合データタイプに対応するため、各データビューごとに異なる凸損失関数(例:二乗誤差、尤度関数、ブレグマン損失)を用いて、統合的一般化凸クラスタリング(iGecco)を定式化する。
  • サンプル単位の類似性を促進することで、グループ割り当てにおける共通のクラスタ構造を誘導するため、複数ビュー間で結合融合ペナルティを適用する。
  • 各ビュー固有の損失関数に最適な中心に向かって特徴を縮小することで、スパースかつ解釈可能な特徴選択を可能にする、適応的シフト付きグループラッソペナルティを導入する。
  • 最適化問題を効率的に解くため、部分問題の近似を用いた一般化されたマルチブロックADMMアルゴリズムを開発する。
  • 滑らかでない、分離不可能な最適化問題に対して、提案されたADMM変種のグローバル収束性を証明する。
  • 混合データタイプにおける同時クラスタリングおよび特徴選択を可能にする、Gecco+ および iGecco+ へのフレームワークの拡張。

実験結果

リサーチクエスチョン

  • RQ1異なるデータタイプ(連続値、カウント、カテゴリカル、割合)を有する混合マルチビュー・データを統合的に扱う統一された凸最適化フレームワークは、クラスタリング性能の向上に有効に機能するか?
  • RQ2統合的クラスタリングに特徴選択を効果的に組み込むにはどうすればよいか? これにより、潜在的なグループを区別する情報をもつ特徴を同定できるか?
  • RQ3部分問題の近似を用いた一般化されたマルチブロックADMMアルゴリズムは、高次元で滑らかでない最適化問題を収束保証とともに効率的に解けるか?
  • RQ4iGecco+ は、実世界の高次元混合データ(例:ゲノムおよびテキストデータ)において、既存手法を上回るクラスタリング精度および特徴選択性能を達成するか?
  • RQ5尤度関数や二乗誤差などの異なる損失関数は、損失固有の重心の形成およびそれによるクラスタリング構造にどのように影響を与えるか?

主な発見

  • iGecco+ は、合成データおよび実世界のデータ(ゲノムおよびテキストマイニング応用を含む)において、クラスタリング精度および特徴選択性能の両面で優れた実験的性能を達成した。
  • 適応的シフト付きグループラッソペナルティは、各データビューにおいて、発見されたクラスタを最も効果的に分離する関連する特徴を的確に同定し、解釈性とモデル性能を向上させた。
  • 部分問題の近似を用いた一般化されたマルチブロックADMMアルゴリズムにより、大規模データセットにおける計算が効率的に行え、標準的なADMM手法と比較して著しく実行時間を短縮した。
  • 凸形式に起因する強力な統計的および数学的性質のおかげで、グローバル最適性およびデータ摂動に対する安定性を示した。
  • TCGAマルチオミクスデータセットにおいて、iGecco+ はガウス分布(遺伝子発現、タンパク質)、割合値(メチル化)、歪度のある分布(miRNA)を有するデータを効果的に処理し、整合性のあるクラスタリング結果を生成した。
  • 著者らのデータセットにおけるGecco+の解の可視化により、選択された特徴が真の著者グループを効果的に分離していることが確認され、本手法が生物学的および文脈的に意味のある特徴を同定できることを裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。