Skip to main content
QUICK REVIEW

[論文レビュー] DeepCancer: Detecting Cancer through Gene Expressions via Deep Generative Learning

Rajendra R. Bhat, Vivek Viswanath|arXiv (Cornell University)|Dec 9, 2016
Gene expression and cancer classification参考文献 24被引用数 14
ひとこと要約

DeepCancer は、生成対抗ネットワーク(GANs)を用いた深層生成学習フレームワークを提案し、ラベルなしマイクロアレイデータから判別性の高い遺伝子発現特徴を抽出する。その後、従来の分類器を用いて分類する。このモデルは乳がんデータセットで最高100%の精度と84%のF1スコアを達成し、前立腺がんデータセットでは100%のF1スコアを記録し、誤検出と誤検出の両方を顕著に低減した。

ABSTRACT

Transcriptional profiling on microarrays to obtain gene expressions has been used to facilitate cancer diagnosis. We propose a deep generative machine learning architecture (called DeepCancer) that learn features from unlabeled microarray data. These models have been used in conjunction with conventional classifiers that perform classification of the tissue samples as either being cancerous or non-cancerous. The proposed model has been tested on two different clinical datasets. The evaluation demonstrates that DeepCancer model achieves a very high precision score, while significantly controlling the false positive and false negative scores.

研究の動機と目的

  • がん診断における高次元遺伝子発現データの課題に、深層生成モデルを用いて対処すること。
  • 生のマイクロアレイデータから内在的特徴を直接学習することで、手動による特徴工学の必要性を排除すること。
  • 敵対的特徴学習を用いて、炎症性乳がん(IBC)および前立腺がんの分類精度を向上させること。
  • さまざまな学習率および訓練エポック数におけるモデルの頑健性を評価すること。
  • 実世界のデータセットを用いて、臨床ゲノミクス分野における GAN を用いた特徴学習の有効性を示すこと。

提案手法

  • モデルは、ラベルなし遺伝子発現データ上で敵対的に訓練される生成ネットワーク(Generator)と識別ネットワーク(Discriminator)を有する生成対抗ネットワーク(GAN)を採用する。
  • 識別ネットワークは、実際の遺伝子発現サンプルと生成されたサンプルを区別するように学習し、複雑なデータ分布を捉える。
  • 識別ネットワークで学習された特徴は、教師あり二値分類のためのシグモイド活性化関数を経由して処理される。
  • フレームワークは、炎症性乳がんと前立腺がんの2つの臨床データセットを用いてテストされた。
  • 学習率や訓練エポック数といったハイパーパrameterは、性能最適化のために体系的に調整された。
  • 特徴学習および分類性能における優位性を検証するため、ベースラインとして RMB を用いたアプローチと比較された。

実験結果

リサーチクエスチョン

  • RQ1ラベルなし遺伝子発現データからの敵対的特徴学習は、がん分類性能を向上させることができるか?
  • RQ2学習率および訓練エポック数の変動が、モデルの精度、再現率、F1スコアに与える影響は何か?
  • RQ3炎症性乳がんのような希少がんタイプにおいて、GAN を用いたモデルは高精度を達成し、誤検出と誤検出を最小限に抑えることができるか?
  • RQ4分類精度および頑健性の観点から、標準的な RMB を用いたベースラインと比較して、GAN を用いたモデルの性能はどのように異なるか?
  • RQ5非 IBC または非前立腺がんサンプルで学習したモデルが、未知のがん亜型にどの程度一般化できるか?

主な発見

  • タスク1(乳がん)では、平均 F1 スコアが 84% に達し、良好な全体的な分類性能を示した。
  • タスク2(非 IBC 対 IBC)では、学習率 0.00003 の条件下で、精度 55%、再現率 100%、F1 スコア 70% を記録した。
  • 高い学習率 0.001 では、精度が 25% に低下し、F1 スコアも 40% にまで低下した。これは、過度な最適化による不安定性を示唆している。
  • タスク3(非前立腺組織)では、2 エポック後、精度 100%、再現率 79%、F1 スコア 84% を達成した。
  • エポック数を 2 から 8 に増加させることで、精度と F1 スコアが向上した。これは、長時間の訓練が性能向上に寄与することを示している。
  • α=0.0003 の時点で精度が急激に上昇したが、これは勾配降下法が一時的に局所最小値に閉じ込められた可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。