[論文レビュー] Evaluating deep variational autoencoders trained on pan-cancer gene expression
本研究では、The Cancer Genome Atlas (TCGA) のパニックセルRNA-seqデータを用いてトレーニングされたディープ変分オートエンコーダー(VAE)を評価し、PCA、ICA、NMF、ADAGEと比較して次元削減を検討した。より深いVAEは僅かな性能向上しか示さないが、VAEの潜在空間は生物学的に意味のあるパターンを明らかにし、特に高悪性度汎巣性卵巣がん(HGSC)サブタイプ比較において、ミエレンキシマルサブタイプに関連するコラーゲン分解代謝過程を同定した。
Cancer is a heterogeneous disease with diverse molecular etiologies and outcomes. The Cancer Genome Atlas (TCGA) has released a large compendium of over 10,000 tumors with RNA-seq gene expression measurements. Gene expression captures the diverse molecular profiles of tumors and can be interrogated to reveal differential pathway activations. Deep unsupervised models, including Variational Autoencoders (VAE) can be used to reveal these underlying patterns. We compare a one-hidden layer VAE to two alternative VAE architectures with increased depth. We determine the additional capacity marginally improves performance. We train and compare the three VAE architectures to other dimensionality reduction techniques including principal components analysis (PCA), independent components analysis (ICA), non-negative matrix factorization (NMF), and analysis of gene expression by denoising autoencoders (ADAGE). We compare performance in a supervised learning task predicting gene inactivation pan-cancer and in a latent space analysis of high grade serous ovarian cancer (HGSC) subtypes. We do not observe substantial differences across algorithms in the classification task. VAE latent spaces offer biological insights into HGSC subtype biology.
研究の動機と目的
- パニックセル遺伝子発現データに対するVAEのアーキテクチャの深さを増した場合の性能を評価すること。
- VAEを従来の次元削減手法(PCA、ICA、NMF、ADAGE)と比較し、教師ありおよび教師なしのタスクにおける性能を評価すること。
- VAEの潜在空間が生物学的に意味のある表現を提供するかどうか、特に高悪性度汎巣性卵巣がん(HGSC)の分子サブタイプを同定する能力を評価すること。
- 遺伝子発現データから疾患関連の生物学的経路を明らかにするために、潜在空間の算術的演算の有効性を調査すること。
提案手法
- KerasとTensorFlowバックエンドを用いて、1層隠れ層(Tybalt)および100および300ユニットの2層隠れ層モデルを含む3種類のVAEアーキテクチャをトレーニングした。
- ホールドアウト検証損失を最小化するため、学習率、バッチサイズ、エポック数、KLウォームアップ用のkappaのグリッドサーチを実施した。
- VAE、NMF、ADAGEにはゼロ・オール・ノーマライゼーションを、PCAおよびICAにはlog2(FPKM+1) TCGA RNA-seqデータ(10,459サンプル)に対してzスコアノーマライゼーションを適用した。
- Elastic netロジスティック回帰を用いて、5-fold交差検証によりNF1不活性化の予測性能を評価した。
- メシエンキシマルおよびインムノリアクティブHGSCサブタイプの平均ベクトル表現を差し引くことで、潜在空間の算術的演算を実施し、特徴の差異を同定した。
- 遺伝子オントロロジー(GO)用語を用いて、差分結果から高重み遺伝子の経路オーバーリプレゼンテーション解析(ORA)を実施した。
実験結果
リサーチクエスチョン
- RQ1VAEアーキテクチャの深さを増すことで、パニックセル遺伝子発現データにおける生物学的に関連するパターンの捉え込み性能にどのような影響を与えるか?
- RQ2VAEは、従来の次元削減手法(PCA、ICA、NMF、ADAGE)と比較して、がん全体にわたるNF1不活性化の予測においてどのように性能を示すか?
- RQ3VAEの潜在空間における算術的演算は、高悪性度汎巣性卵巣がん(HGSC)サブタイプ間の生物学的に意味のある差を明らかにできるか?
- RQ4メシエンキシマルおよびインムノリアクティブHGSCサブタイプ間で、VAEの潜在空間において最も顕著に差異が見られる生物学的経路は何か?
主な発見
- 2層隠れ層を持つより深いVAEアーキテクチャは、1層隠れ層のTybaltモデルと比較して僅かな性能向上しか示さず、検証損失の低下も限定的であった。
- パニックセルがん全体におけるNF1不活性化の予測において、生の遺伝子発現特徴量が最も優れた性能(AUROC = 68.4%)を示し、次にPCA(AUROC = 65.6%)が続いた。VAEは他の次元削減手法と同等の性能を示した。
- ランダムシャッフルされた遺伝子発現コントロールデータセットではAUROC = 55.4%を示し、分類タスクにおける低サンプルサイズに起因するアーチファクトの可能性が示唆された。
- VAEベースの潜在空間、特にTybaltおよび300ユニットの2層隠れ層VAEは、HGSCサブタイプ比較において「コラーゲン分解代謝過程」を最も顕著に過剰に表現するGO用語として特定した(p = 1.8e-09および1.7e-03)。
- 線形手法(PCA、ICA、NMF)は経路の豊富さが限定的または有意でなく、NMFのみが「相同性細胞接着」(p = 3.3e-06)を唯一の有意な用語として同定した。
- ADAGEおよびICAはORA解析で有意な経路を同定できず、非線形VAE表現が有する独自の生物学的インサイトの重要性を強調した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。