[論文レビュー] A Framework for Implementing Machine Learning on Omics Data
本論文は、マイクロアレイおよびRNA-Seqデータセットなど、異なるソースからのマルチオミクスデータを統合する機械学習フレームワークを提示する。3,533例の乳がん患者から得られたMETABRIC、TCGAマイクロアレイ、TCGA RNA-Seqデータを統合し、統一された高次元データセットを構築することで、個々のデータセットよりも精度が高くばらつきが少ない生存予測が可能となり、SVM-RBFを用いた場合、AUCが最大0.81に達した。
The potential benefits of applying machine learning methods to -omics data are becoming increasingly apparent, especially in clinical settings. However, the unique characteristics of these data are not always well suited to machine learning techniques. These data are often generated across different technologies in different labs, and frequently with high dimensionality. In this paper we present a framework for combining -omics data sets, and for handling high dimensional data, making -omics research more accessible to machine learning applications. We demonstrate the success of this framework through integration and analysis of multi-analyte data for a set of 3,533 breast cancers. We then use this data-set to predict breast cancer patient survival for individuals at risk of an impending event, with higher accuracy and lower variance than methods trained on individual data-sets. We hope that our pipelines for data-set generation and transformation will open up -omics data to machine learning researchers. We have made these freely available for noncommercial use at www.ccg.ai.
研究の動機と目的
- 複数のソースおよび技術から得られる高次元で異種のオミクスデータを統合し、機械学習応用に向けた課題に対処すること。
- 統合オミクスデータを用いて、乳がん患者の短期間生存予測の精度を向上させるとともに、ばらつきを低減すること。
- 研究者がオミクスデータの前処理、変換、機械学習モデルの適用を可能にする再現性がありオープンソースのパイプラインを開発すること。
- データ統合および次元削減技術が、臨床アウトカム予測におけるモデル性能を向上させる有効性を示すこと。
- 標準化された前処理およびモデリングワークフローを提供することで、高次元オミクスデータを機械学習研究者によりアクセス可能にすること。
提案手法
- METABRIC、TCGAマイクロアレイ、TCGA RNA-Seqデータセットから、遺伝子発現(RNA-Seqおよびマイクロアレイ)およびコピー数異常(CNA)データを統合し、プラットフォーム間で患者および遺伝子を整合化する。
- 3,533名の患者と15,233個の共通遺伝子のユニオンを用いてデータを正規化・統合し、統合的クラスタ分類などの生物学的関連性を保持する。
- 臨床的生存データは、生存期間の閾値(24か月および60か月)に基づいてターゲット変数を定義し、censoringはmin(T_i, L_i)を用いて二値ラベルに変換する。
- 次元削減にt-SNEを適用し、高次元データを低次元空間(例:3次元、15次元)に投影することで、モデルの汎化性能を向上させる。
- SVM-RBF、ガウス過程、MLP、ランダムプロジェクションアンサンブルなどの複数の分類器を、生データまたは投影済みデータ上で訓練し、10分割交差検証を用いてハイパーパrameterを最適化する。
- 生存関数S_T(t)の推定にニューラルネットワーク回帰器を用い、予測値とcensoringされた生存時間との間の平均二乗誤差を最小化する。
実験結果
リサーチクエスチョン
- RQ1マイクロアレイやRNA-Seqなどの異種のソースからのマルチオミクスデータ統合は、乳がん生存予測における機械学習性能を向上させることができるか?
- RQ2t-SNEによる次元削減は、高次元オミクスデータに対する機械学習モデルの予測性能を向上させるか?
- RQ3個々のデータセットで訓練されたモデルと比較して、統合データで訓練されたモデルのAUCおよびばらつきはどのように異なるか?
- RQ4統一されたパイプラインは、非専門の機械学習研究者のオミクスデータの前処理およびモデリングを容易にするか?
- RQ5データ統合および特徴量の投影は、生存予測モデルの安定性および正確性にどのような影響を与えるか?
主な発見
- METABRIC、TCGAマイクロアレイ、TCGA RNA-Seqの3,533例の乳がん患者からなる統合データセットは、統合的サブタイプにおける明確な疾患非発症生存パターンを含む、主要な生物学的特徴を保持した。
- SVM-RBFは、統合されたRNA-Seqおよびマイクロアレイデータ上で学習した場合、METABRIC単体で得られた0.662のAUCを大きく上回り、AUCが0.815に達した。
- t-SNEの投影によりモデル性能が向上し、ガウス過程分類器は3次元t-SNE投影で0.755のAUCを達成したのに対し、生データでは0.500にとどまった。
- ランダムプロジェクションアンサンブル分類器は、保留テストデータにおいて2年生存予測でAUC 0.76、5年生存予測でAUC 0.79を達成した。
- ニューラルネットワーク回帰器は、生データ上で検証AUC 0.720を達成し、連続的な生存関数の推定に有効であることが示された。
- フレームワークは、個々のデータセットで訓練されたモデルと比較して、モデルのばらつきを低減し、複数のアルゴリズムで一貫した向上を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。