Skip to main content
QUICK REVIEW

[論文レビュー] A Cross-Level Information Transmission Network for Predicting Phenotype from New Genotype: Application to Cancer Precision Medicine

Di He, Lei Xie|arXiv (Cornell University)|Oct 9, 2020
Machine Learning in Bioinformatics参考文献 34被引用数 5
ひとこと要約

本稿では、遺伝子型(突然変異)から表現型(薬剤感受性)への非対称的かつ多段階の情報フローを中間オミクス層(例:遺伝子発現)を介してモデル化する、深層学習フレームワークであるクロスレベル情報伝送(CLEIT)を提案する。対照的損失と未ラベルデータにおける事前学習を用いたドメイン適応により、単一の体細胞突然変異からのがん治療薬応答の予測が向上し、最先端手法を13.3%上回る皮積相関(薬剤別)と5%上回る上位5位精度を達成した。

ABSTRACT

An unsolved fundamental problem in biology and ecology is to predict observable traits (phenotypes) from a new genetic constitution (genotype) of an organism under environmental perturbations (e.g., drug treatment). The emergence of multiple omics data provides new opportunities but imposes great challenges in the predictive modeling of genotype-phenotype associations. Firstly, the high-dimensionality of genomics data and the lack of labeled data often make the existing supervised learning techniques less successful. Secondly, it is a challenging task to integrate heterogeneous omics data from different resources. Finally, the information transmission from DNA to phenotype involves multiple intermediate levels of RNA, protein, metabolite, etc. The higher-level features (e.g., gene expression) usually have stronger discriminative power than the lower level features (e.g., somatic mutation). To address above issues, we proposed a novel Cross-LEvel Information Transmission network (CLEIT) framework. CLEIT aims to explicitly model the asymmetrical multi-level organization of the biological system. Inspired by domain adaptation, CLEIT first learns the latent representation of high-level domain then uses it as ground-truth embedding to improve the representation learning of the low-level domain in the form of contrastive loss. In addition, we adopt a pre-training-fine-tuning approach to leveraging the unlabeled heterogeneous omics data to improve the generalizability of CLEIT. We demonstrate the effectiveness and performance boost of CLEIT in predicting anti-cancer drug sensitivity from somatic mutations via the assistance of gene expressions when compared with state-of-the-art methods.

研究の動機と目的

  • 環境的撹乱下における新規遺伝子型(体細胞突然変異)からの表現型(例:薬剤感受性)の予測という課題に対処すること。
  • 高次元のオミクスデータ、ラベルなしデータの不足、異種データ統合の制限といった既存手法の限界を克服すること。
  • DNAから表現型に至る中間分子層を経由する非対称的かつ多段階の生物学的情報フローを明示的にモデル化すること。
  • 事前学習と微調整を用いた未ラベルオミクスデータの統合により、精密腫瘍学における汎用性と性能を向上させること。
  • 構造的かつ階層的な深層学習フレームワークを用いて、遺伝子型-表現型モデルの解釈可能性と予測精度を向上させること。

提案手法

  • CLEITは、高レベルドメイン(例:遺伝子発現)と低レベルドメイン(例:体細胞突然変異)を有するクロスレベルアーキテクチャを採用し、情報伝達を高レベルから低レベルへとモデル化する。
  • 低レベル表現が高レベル特徴の潜在埋め込みと一致するように、対照的損失を用いることで、より判別性の高い層からの知識移行を可能にする。
  • 高レベル特徴をソースドメイン、低レベル特徴をターゲットドメインとして扱うことで、ドメイン適応の原則を応用する。
  • 事前学習・微調整戦略を適用:未ラベルの異種オミクスデータで事前学習し一般表現を学習した後、ラベル付き薬剤応答データで微調整を行う。
  • エンコーダーおよびデコーダーヘッドにSELU活性化関数、層正則化、ドロップアウトを用い、薬剤応答予測のための共有回帰ヘッドを備える。
  • 送信モジュールは、低レベル特徴を高レベル潜在空間にマップする機能を学習し、生物学的レベル間を貫く構造的な情報フローを可能にする。

実験結果

リサーチクエスチョン

  • RQ1遺伝子発現などの上位オミクス情報を利用することで、体細胞突然変異データのみからがん治療薬感受性を効果的に予測できる深層学習モデルは存在するか?
  • RQ2DNA → RNA → プロテイン → 表現型という生物学的レベル間の非対称的情報伝達をモデル化することで、対称的または平坦なアーキテクチャと比較して、遺伝子型-表現型予測がどの程度向上するか?
  • RQ3対照的損失は、MMD や WGAN などの他のドメイン適応損失と比較して、表現型予測のための低レベルおよび高レベル表現の一致にどの程度優れているか?
  • RQ4未ラベルオミクスデータにおける事前学習は、データが少ない状況下でのモデルの汎用性と性能をどの程度向上させるか?
  • RQ5CLEITフレームワークは、新規のがん患者の突然変異プロファイルのみに基づいて、上位ランクの治療法を推薦できるか?

主な発見

  • CLEITは、すべてのベースラインモデルを大きく上回り、最も優れたSOTA手法(DSN)と比較して、皮積相関(薬剤別)で13.3%の向上を達成した。
  • 対照的損失を用いたCLEITモデルが、MMD や WGAN ベースの変種を上回り、クロスレベル表現学習における対照的整合の優位性を示した。
  • 上位-kランク治療法の予測において、k=5のとき、2番目に優れたモデル(DSN)と比較して精度が約5%向上し、精密医療における実用的有用性が顕著に示された。
  • アブレーションスタディにより、MLPベースの伝送関数と事前学習が性能に不可欠であることが確認され、それらを除去すると精度が著しく低下した。
  • モデルの性能は薬剤別およびサンプル別評価指標の両方で安定しており、未観測の患者データに対しても汎用性が裏付けられた。
  • 事前学習を用いた未ラベルオミクスデータの有効活用により、ラベル付き薬剤応答データが限られた状況でも表現学習が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。