Skip to main content
QUICK REVIEW

[論文レビュー] Incorporating Prior Knowledge in Deep Learning Models via Pathway Activity Autoencoders

Pedro Avelar, Min Wu|arXiv (Cornell University)|Jun 9, 2023
RNA and protein synthesis mechanismsBiochemistry, Genetics and Molecular Biology被引用数 3
ひとこと要約

本稿では、RNA-seqデータに対する深層自己符号化モデルの解釈可能性と予測性能を向上させるために、生物学的シグナルパスウェイの知識を統合したパスウェイ活性自己符号化器(PAAE)およびその生成的拡張版(PAVAE)を提案する。既知のパスウェイを用いて潜在空間を制約することで、入力特徴量が少ない状況でも、標準的な自己符号化器やVAEを上回る優れた再構成性能と分類精度を達成し、同時に学習された表現の直接的な生物学的解釈が可能になる。

ABSTRACT

Motivation: Despite advances in the computational analysis of high-throughput molecular profiling assays (e.g. transcriptomics), a dichotomy exists between methods that are simple and interpretable, and ones that are complex but with lower degree of interpretability. Furthermore, very few methods deal with trying to translate interpretability in biologically relevant terms, such as known pathway cascades. Biological pathways reflecting signalling events or metabolic conversions are Small improvements or modifications of existing algorithms will generally not be suitable, unless novel biological results have been predicted and verified. Determining which pathways are implicated in disease and incorporating such pathway data as prior knowledge may enhance predictive modelling and personalised strategies for diagnosis, treatment and prevention of disease. Results: We propose a novel prior-knowledge-based deep auto-encoding framework, PAAE, together with its accompanying generative variant, PAVAE, for RNA-seq data in cancer. Through comprehensive comparisons among various learning models, we show that, despite having access to a smaller set of features, our PAAE and PAVAE models achieve better out-of-set reconstruction results compared to common methodologies. Furthermore, we compare our model with equivalent baselines on a classification task and show that they achieve better results than models which have access to the full input gene set. Another result is that using vanilla variational frameworks might negatively impact both reconstruction outputs as well as classification performance. Finally, our work directly contributes by providing comprehensive interpretability analyses on our models on top of improving prognostication for translational medicine.

研究の動機と目的

  • 高スループットオミクスデータに対する深層学習モデルの解釈不能性を解消するため、生物学的に意味のある事前知識を統合すること。
  • パスウェイにインスパイアされた自己符号化器を用いて、患者の分類と生存予測を改善し、生物学的用語で直接解釈可能な潜在表現を学習すること。
  • パスウェイ情報が構造的インダクティブバイアスとして機能することで、標準的な自己符号化器やVAEと比較して再構成性能および分類性能が向上するかどうかを評価すること。
  • パスウェイ活性に基づく表現が、TCGA や METABRIC などの独立したデータセット間で一貫しており、分類や生存解析などの下流タスクに有用であるかどうかを示すこと。
  • 臨床医や研究者が、知られている生物学的パスウェイを通じてモデル出力を解釈できるフレームワークを提供し、翻訳的医療を支援すること。

提案手法

  • 既知の生物学的パスウェイを構造的インダクティブバイアスとして用いる非生成的自己符号化器フレームワーク、PAAEを提案する。
  • パスウェイ活性ベクトルを、サンプルごとの事前定義されたパスウェイの活性化レベルとして定義し、遺伝子セット豊度スコアを用いて計算する。
  • 入力遺伝子発現データの再構成を、潜在表現としてのパスウェイ活性ベクトルのみを用いて行うことで、生物学的解釈可能性を強制的に実現する。
  • PAAEを生成的バージョンに拡張し、変分推論を用いて学習された潜在空間からのサンプリングを可能にするPAVAEを構築する。
  • PAVAEでは再パラメータライゼーショントリックを適用し、パスウェイ活性のサンプリングプロセスを逆伝播可能にすることで、エンド・ツー・エンドの学習を可能にする。
  • UMAPおよびコサイン距離の可視化を用いて、学習されたパスウェイ活性空間のトポロジーを分析し、クラス分離性を評価する。

実験結果

リサーチクエスチョン

  • RQ1既知の生物学的パスウェイをインダクティブバイアスとして統合することで、RNA-seqデータに対する自己符号化器の再構成性能が向上するか?
  • RQ2パスウェイ活性に基づく潜在表現を用いることで、全遺伝子セットを用いるモデルと比較して分類性能が向上するか?
  • RQ3PAAEおよびPAVAEの再構成性能および分類精度は、標準的な自己符号化器やVAEと比較してどの程度優れているか?
  • RQ4学習済みのパスウェイ活性は、TCGA や METABRIC などの独立したデータセット間でどの程度一貫しているか?
  • RQ5モデルの潜在空間は、がん亜型に関連する既知の生物学的パスウェイの観点から意味的に解釈可能か?

主な発見

  • PAAEおよびPAVAEは、全遺伝子セットではなくパスウェイ活性特徴のみを用いているにもかかわらず、標準的な自己符号化器やVAEを上回る出先外再構成性能を達成した。
  • ベースラインが全入力遺伝子にアクセスできる状況でも、PAAEおよびPAVAEは分類タスクで優れた性能を示し、表現学習における事前知識の価値を示した。
  • ヴァニラVAEは、再構成および分類の両面でPAAEおよびPAVAEより劣った性能を示した。これは、標準的な変分フレームワークがパスウェイにインスパイアされた学習には最適でない可能性を示唆している。
  • 学習セットで疾患亜型と相互情報量が最も高い32のパスウェイは、テストセットでも最も情報量の多い特徴であった。これは、データセット間で一貫した特徴学習が行われていることを示している。
  • UMAPおよび特徴マップを用いたパスウェイ活性空間の可視化では、臨床的表型(例:BRCA亜型)に応じた明確なクラスタリングが観察され、学習された表現の生物学的妥当性を裏付けた。
  • 解釈可能性解析から、p53シグナル伝達、ミスマッチ修復、バリン・ロイシン・イソロイシン分解など、個々のパスウェイががん分類の文脈で強く判別可能で生物学的に妥当であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。