Skip to main content
QUICK REVIEW

[論文レビュー] Ultra High-Dimensional Nonlinear Feature Selection for Big Biological Data

Makoto Yamada, Jiliang Tang|arXiv (Cornell University)|Aug 14, 2016
Metabolomics and Mass Spectrometry Studies参考文献 48被引用数 9
ひとこと要約

本稿では、HSIC Lassoと分散コンピューティングを組み合わせることで、スケーラブルな特徴選択手法であるLAND(Least Angle Nonlinear Distributed)を提案する。この手法は、100万以上の特徴を持つ超高次元の生物学的データから、予測能が高く、重複のない最小の特徴集合を同定することを目的としており、実世界のデータセット(前立腺がんの表現型や酵素分類など)において、次第に予測精度を維持または向上させながら、次第に次元削減率が99.998%に達する。

ABSTRACT

Machine learning methods are used to discover complex nonlinear relationships in biological and medical data. However, sophisticated learning models are computationally unfeasible for data with millions of features. Here we introduce the first feature selection method for nonlinear learning problems that can scale up to large, ultra-high dimensional biological data. More specifically, we scale up the novel Hilbert-Schmidt Independence Criterion Lasso (HSIC Lasso) to handle millions of features with tens of thousand samples. The proposed method is guaranteed to find an optimal subset of maximally predictive features with minimal redundancy, yielding higher predictive power and improved interpretability. Its effectiveness is demonstrated through applications to classify phenotypes based on module expression in human prostate cancer patients and to detect enzymes among protein structures. We achieve high accuracy with as few as 20 out of one million features --- a dimensionality reduction of 99.998%. Our algorithm can be implemented on commodity cloud computing platforms. The dramatic reduction of features may lead to the ubiquitous deployment of sophisticated prediction models in mobile health care applications.

研究の動機と目的

  • 100万以上の特徴と数万件のサンプルを持つ超高次元の生物学的データセットに非線形機械学習を適用する課題に対処すること。
  • モデルの解釈性と性能を向上させるために、予測能が高く、冗長性が最小限の特徴を同定する特徴選択手法を開発すること。
  • 既存の手法の制限を克服し、コンmodityクラウドプラットフォーム上で分散的かつスケーラブルな非線形特徴選択の実装を可能にすること。
  • 前立腺がんの表現型分類や酵素検出といった実世界の生物学的問題に対して、本手法の有効性を示すこと。

提案手法

  • LANDは、非線形かつ冗長性のない特徴選択を可能にするために、最小二乗角度回帰(LARS)とヒルベルト=シュミット独立基準(HSIC)を統合する。
  • スパースかつグローバルに最適な特徴サブセット選択を保証するため、LARSの非負の変種を用いる。
  • パラメータ $ b \ll n $ を用いたランダムスケッチング技術を採用することで、メモリ複雑性を $ O(dn^2) $ から $ O(dbn) $ に低減し、$ d \approx 10^6 $ 個の特徴へのスケーラビリティを実現する。
  • アルゴリズムはコンmodityクラウドプラットフォーム上で分散的に実装され、大規模データセットの効率的処理を可能にする。
  • 特徴選択は、選択された特徴と目的変数の間の非線形依存度(HSICを介して)を最大化するとともに、特徴間の冗長性を最小化することで行われる。
  • 酵素検出のための、最大4リジドのルート付きグラフレットを用いたカスタム特徴表現が採用され、タンパク質構造が高次元ベクトルに変換される。

実験結果

リサーチクエスチョン

  • RQ1非線形特徴選択手法は、100万以上の特徴と数万件のサンプルを持つデータセットにスケーラブルに適用可能か?
  • RQ2分散コンピューティングは、超高次元の生物学的データにおけるスケーラブルかつ非線形の特徴選択を効果的に可能にするか?
  • RQ3提案手法は、最先端の線形および非線形ベースラインと比較して、予測精度と次元削減の両面で優れているか?
  • RQ4選択された特徴は生物学的に解釈可能であるか、例えば酵素の既知の触媒モチーフ(DH:アスパラギン酸ヒスチジン)を同定できるか?

主な発見

  • 酵素分類タスクにおいて、LANDは特徴数を1,062,420個からたった20個にまで削減し、99.998%の次元削減を達成しながらも高い精度を維持した。
  • 前立腺がんデータセットでは、100万個の特徴のうちたった20個を用いても高い分類精度を達成し、最小限の冗長性で強い予測力を持つことを示した。
  • 100個未満の特徴を選択する際、mRMR や MR-NHSIC といったすべてのベースラインを上回る精度を達成した。特に、超低次元領域では顕著な優位性を示した。
  • 同じ酵素データセットで、フルグラフカーネル分類器が18日間を要するのに対し、LANDはクラスタ上でわずか3時間で実行された。これは著しい高速化を示している。
  • 冗長性解析(図6(B))により、LANDがベースラインと比較して著しく冗長性の低い特徴を選択していることが確認された。
  • LANDは、触媒部位に一般的に見られることが知られるDH(アスパラギン酸ヒスチジン)グラフレットという生物学的に関連性のあるモチーフを効果的に同定し、その生物学的解釈可能性を裏付けた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。