[論文レビュー] Convolutional neural networks for structured omics: OmicsCNN and the OmicsConv layer
本論文は、特徴量をメトリック空間に埋め込むことで、新しいOmicsConv Kerasレイヤーを用いて畳み込みニューラルネットワーク(CNN)を構造的オミックスデータに適応させる、深層学習フレームワークであるOmicsCNNを提案する。この手法により、系統発生的パトリスティック距離とマルチレイヤー・ネットワーク拡散距離を用いて、メタゲノムおよびトランスクリプトミクスデータ上でCNNを適用可能にし、特に挑戦的なIBD亜型において、SVM やランダムフォレストといった従来モデルよりも優れた分類性能を達成した。
Convolutional Neural Networks (CNNs) are a popular deep learning architecture widely applied in different domains, in particular in classifying over images, for which the concept of convolution with a filter comes naturally. Unfortunately, the requirement of a distance (or, at least, of a neighbourhood function) in the input feature space has so far prevented its direct use on data types such as omics data. However, a number of omics data are metrizable, i.e., they can be endowed with a metric structure, enabling to adopt a convolutional based deep learning framework, e.g., for prediction. We propose a generalized solution for CNNs on omics data, implemented through a dedicated Keras layer. In particular, for metagenomics data, a metric can be derived from the patristic distance on the phylogenetic tree. For transcriptomics data, we combine Gene Ontology semantic similarity and gene co-expression to define a distance; the function is defined through a multilayer network where 3 layers are defined by the GO mutual semantic similarity while the fourth one by gene co-expression. As a general tool, feature distance on omics data is enabled by OmicsConv, a novel Keras layer, obtaining OmicsCNN, a dedicated deep learning framework. Here we demonstrate OmicsCNN on gut microbiota sequencing data, for Inflammatory Bowel Disease (IBD) 16S data, first on synthetic data and then a metagenomics collection of gut microbiota of 222 IBD patients.
研究の動機と目的
- 構造的オミックスデータにおける特徴量距離の理論的枠組みを確立することで、CNNが非画像オミックスデータに適用可能な限界を克服すること。
- メトリックに基づく畳み込みを統合する一般化された深層学習アーキテクチャ、OmicsCNNの開発。
- 合成データを用いた事前学習により、サンプル数が少ないオミックス設定におけるドメイン適応を可能にすること。
- オミックス分類における誠実な性能評価のための再現可能でバイアスのない実験プロ rotocol(DAP)の提供。
- 炎症性腸疾患(IBD)亜型の実世界の腸内マイクロバイオームデータに対して、本手法の有効性を実証すること。
提案手法
- OmicsConvは、特徴量間の学習済みまたは事前定義された距離メトリックを用いて畳み込みを計算するカスタムKerasレイヤーであり、近傍に基づくフィルタリングを可能にする。
- メタゲノムでは、系統発生樹上のパトリスティック距離が特徴量の近接性を定義する。トランスクリプトミクスでは、4層のマルチレイヤー・ネットワークがGene Ontologyの意味的類似性と遺伝子共発現を統合する。
- 活性化関数にはスケーリング指数線形ユニット(SELU)を、最適化には学習率0.0005のAdamを使用する。
- 過学習と選択バイアスを防ぐために、10×5-fold交差検証に基づくデータ分析プロトコル(DAP)を実装し、特徴量ランク付けにはボーダ集約法を用いる。
- ドメイン適応は、初期層を凍結した上で、大規模な合成データセットでOmicsCNNを事前学習した後、実際のIBDデータで微調整することで実現する。
- 全パイプラインはPython/Scikit-LearnおよびKeras v2.0.8で実装され、GPU加速されたAzureインfraストラクチャにデプロイされている。
実験結果
リサーチクエスチョン
- RQ1意味のある特徴量距離メトリックを定義することで、非画像オミックスデータに畳み込みニューラルネットワークを効果的に適用できるか?
- RQ2OmicsCNNは、IBD腸内マイクロバイオームデータのようなサンプル数が少ないオミックスデータセットにおいて、古典的機械学習モデルと比較してどのように性能を発揮するか?
- RQ3合成データを用いた事前学習は、実データが限られるオミックス分類タスクにおける一般化性能を向上させるか?
- RQ4系統発生樹やGene Ontologyといった生物学的知識を距離メトリックに組み込むと、オミックス表現にどのような影響を与えるか?
- RQ5OmicsCNNフレームワークは、標準的な深層学習や浅いモデルと比較して、より解釈可能で頑健なバイオマーカーを提供できるか?
主な発見
- OmicsCNNは、回腸型Crohn病(iCDf)の分類において、MCCが0.858に達し、次に優れたモデル(RFはF1スコア0.920だがMCCは低め)を大きく上回り、LSVM(0.418)やMLPNN(0.401)をも凌駆した。
- 最も挑戦的なタスク、すなわちiCDfにおいて、OmicsCNNはベースラインのLSVMよりMCCで42%の改善を示し、希少または複雑な亜型においても優れた一般化性能を示した。
- 潰瘍性大腸炎の発作(UCf)においては、OmicsCNNがMCC 0.741を達成し、最良のLSVM(0.740)と同等の性能を示したが、MLPNN(0.666)やRF(0.699)を上回った。
- OmicsCNNは、IBDの6つの亜型すべてにおいて頑健な性能を示し、6つのタスクのうち4つで優れた性能を発揮した。特にCDおよびiCDのような高複雑度条件で顕著な優位性を示した。
- 合成データを用いた事前学習により、有効なドメイン適応が可能となり、限られた実IBDサンプルでも一般化性能を発揮できた。
- ランダム化された特徴量およびラベルの実験により、モデルの健全性が確認され、性能向上が過学習やデータリークによるものではないことが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。