Skip to main content
QUICK REVIEW

[論文レビュー] A general multiblock method for structured variable selection

Tommy Löfstedt, Fouad Hadj‐Selem|arXiv (Cornell University)|Oct 29, 2016
Statistical Methods and Inference参考文献 11被引用数 4
ひとこと要約

本稿では、スパースGCCAを一般化し、全RGCCAフレームワーク内に構造的でスパarsity誘導型のペナルティを組み込むことで、任意の$\tau \in [0,1]$とグループラassoや全変動などの構造的ペナルティによる柔軟な正則化を可能にする多ブロック手法を提案する。この手法は、シミュレートされたデータにおいて真の潜在的重みベクトルを的確に回復でき、高悪性度グリオーマデータセットにおいて臨床的に関連する遺伝子群を同定し、変数選択と予測性能の両方で優れた結果を示した。

ABSTRACT

Regularised canonical correlation analysis was recently extended to more than two sets of variables by the multiblock method Regularised generalised canonical correlation analysis (RGCCA). Further, Sparse GCCA (SGCCA) was proposed to address the issue of variable selection. However, for technical reasons, the variable selection offered by SGCCA was restricted to a covariance link between the blocks (i.e., with $τ=1$). One of the main contributions of this paper is to go beyond the covariance link and to propose an extension of SGCCA for the full RGCCA model (i.e., with $τ\in[0, 1]$). In addition, we propose an extension of SGCCA that exploits structural relationships between variables within blocks. Specifically, we propose an algorithm that allows structured and sparsity-inducing penalties to be included in the RGCCA optimisation problem. The proposed multiblock method is illustrated on a real three-block high-grade glioma data set, where the aim is to predict the location of the brain tumours, and on a simulated data set, where the aim is to illustrate the method's ability to reconstruct the true underlying weight vectors.

研究の動機と目的

  • SGCCAにおける制限(正則化が$\tau=1$(共分散リンク)に限定される)を克服し、RGCCAフレームワーク全体で正則化の柔軟性を実現すること。
  • ブロック内での変数関係に関する事前知識を活用できるように、グループラassoや全変動などの構造的ペナルティをRGCCA最適化に統合すること。
  • 多ブロックデータ解析において、スパarsityと構造の両方を同時にサポートする一般化されたアルゴリズムを開発すること。
  • 本手法が真の潜在的重みベクトルを回復できるかを、実際の生物学的データ(高悪性度グリオーマ)およびシミュレートデータで検証すること。

提案手法

  • 本手法は、内積における共分散と相関のバランスを調整する$\tau_k \in [0,1]$を導入することで、RGCCAを拡張し、正則化スキームの全範囲をカバー可能にする。
  • 最適化問題に構造的ペナルティ(例:グループラasso、全変動)を導入し、既知の関係性(例:遺伝子群、空間的近接性)を持つ変数を同時に選択可能にする。
  • 一般化されたノルム制約$\mathbf{w}_k^T \mathbf{M}_k \mathbf{w}_k = 1$を最適化問題に定式化し、ここで$\mathbf{M}_k = \tau_k \mathbf{I}_{p_k} + \frac{1-\tau_k}{n-1} \mathbf{X}_k^T \mathbf{X}_k$である。
  • 2次ペナルティに対して高速な射影アルゴリズムを導出し、構造的スパarsityの効率的計算を可能にする。
  • 各ブロックに対して複数のペナルティタイプをサポートし、データ構造(例:遺伝子セットにはグループラasso、空間データには全変動)に応じて正則化を適応可能にする。
  • 構造的制約下での重みベクトルの最適化を交互に繰り返すブロック座標降下法を用いてアルゴリズムを実装する。

実験結果

リサーチクエスチョン

  • RQ1制限的で$\tau=1$に限定される状況を超えて、構造的変数選択をRGCCAフレームワークに効果的に統合できるか?
  • RQ2ノイズや複雑な変数構造が存在する中で、提案手法が真の潜在的重みベクトルをどれほど的確に回復できるか?
  • RQ3実際の多ブロックオミクスデータ(例:グリオーマ腫瘍の位置予測)において、構造的ペナルティが予測性能と生物学的解釈可能性を向上できるか?
  • RQ4シミュレートデータにおいて、異なる構造的ペナルティ(例:グループラasso、全変動)が真の信号パターンをどれほど正確に回復できるか?

主な発見

  • シミュレートデータにおいて、全変動ペナルティが真の潜在的重みベクトルを最も効果的に再構成し、滑らかさを保ちつつノイズを除去し、信号の整合性を維持した。
  • グループラassoペナルティは、真の重みがゼロのグループを効果的に同定・除外し、活性なグループの平均値を近似したが、若干の残存ノイズが残存した。
  • 実際のグリオーマデータセットでは、アルツハイマー病(hsa05010)、アクソン誘導(hsa04360)、ヌクレオチド除去修復(hsa03420)といった生物学的に関連する遺伝子群が同定され、腫瘍の位置と薬剤耐性に関連していることが示された。
  • シトレート回路(TCA回路、hsa00020)はモデルから除外されたが、これは腫瘍の位置予測において特異性が低い可能性と整合的であった。
  • ブートストラップ平均では、第1および第2成分でそれぞれ125.5および126.3のグループが選択されたことから、安定したグループ選択が得られた。
  • 特にノイズの多い第1成分において、全変動ペナルティが真のプロファイルを保持しながら、ノイズ低減と信号回復に優れた性能を示し、非ペナルティRGCCAを上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。