Skip to main content
QUICK REVIEW

[論文レビュー] A Systematic Approach to Featurization for Cancer Drug Sensitivity Predictions with Deep Learning

Austin Clyde, Tom Brettin|arXiv (Cornell University)|Apr 30, 2020
Molecular Biology Techniques and Applications参考文献 44被引用数 7
ひとこと要約

本研究では、がん薬物感受性を予測する深層学習モデルにおける特徴抽出手法を体系的に評価し、35,000体の訓練済みモデルを用いた。RNA-seq特徴量は128以上の特徴量を含むサブセットでも高い情報量を示し、SNPをカウント行列として符号化することで性能が著しく向上することが判明。また、MOregedとDragon7の分子記述子は同等の性能を示し、精密腫瘍学における堅牢で一般化可能な薬物反応予測のための実用的ガイドラインを提供する。

ABSTRACT

By combining various cancer cell line (CCL) drug screening panels, the size of the data has grown significantly to begin understanding how advances in deep learning can advance drug response predictions. In this paper we train >35,000 neural network models, sweeping over common featurization techniques. We found the RNA-seq to be highly redundant and informative even with subsets larger than 128 features. We found the inclusion of single nucleotide polymorphisms (SNPs) coded as count matrices improved model performance significantly, and no substantial difference in model performance with respect to molecular featurization between the common open source MOrdred descriptors and Dragon7 descriptors. Alongside this analysis, we outline data integration between CCL screening datasets and present evidence that new metrics and imbalanced data techniques, as well as advances in data standardization, need to be developed.

研究の動機と目的

  • 複数の細胞線および薬物データセットにおけるがん薬物感受性を予測するための深層学習モデルにおける、多様な特徴抽出戦略の影響を評価すること。
  • 特にRNA-seq、SNP、分子記述子を含む、モデル性能を向上させる最も効果的な遺伝的および分子的特徴量を同定すること。
  • 大規模なモデルスイープにおいて、オープンソース(MOreged)と商業的(Dragon7)の分子記述子を比較すること。
  • 不均衡な薬物反応予測タスクにおいて、回帰的評価指標と分類的評価指標のトレードオフを評価すること。
  • 将来のパニックセルがん薬物反応予測における深層学習モデルのためのスケーラブルで再現可能なフレームワークを提供すること。

提案手法

  • 細胞線プロファイル、薬物表現、スケーリング手法を含む198種類の異なる特徴セットを用い、35,000体以上の深層ニューラルネットワークモデルを訓練した。
  • 複数のモデルアーキテクチャ、トレーニング戦略(例:学習率スケジュール)および交差検証のfold(3-fold、細胞線ベース)をスイープし、モデルの頑健性を評価した。
  • GDSC、CCLE、NCI-60を含む複数の公開データセットを用い、標準化された前処理とデータ統合により統合した。
  • 複数の指標($r^2$、RMSE、バランス精度、マシューズ相関係数(MCC)、AUC)を用いてモデルを評価し、分類タスクとしての後処理としてAUC = 0.5でのバイニングを実施した。
  • 収束不良または過学習の可能性があるモデル(例:TPR/FPR = 1.0、負の $r^2$、損失が85百分位数を超える)を厳密にフィルタリングすることで、信頼性の高い性能評価を確保した。
  • すべてのコードとデータパイプラインを公開し、今後の特徴抽出手法のベンチマークと再現可能性を促進した。

実験結果

リサーチクエスチョン

  • RQ1がん薬物感受性を予測するための深層学習モデルにおいて、どの遺伝的および分子的特徴セットが最高の予測性能を示すか?
  • RQ2特にMOregedとDragon7の分子記述子タイプは、薬物反応予測においてどの程度の予測的有用性を示すか?
  • RQ3RNA-seqおよびSNP特徴量はモデル性能にどの程度寄与しているか、最適な結果を得るにはどの程度の特徴量数が必要か?
  • RQ4不均衡な薬物反応予測タスクにおいて、分類的指標(例:MCC、バランス精度)と回帰的指標(例:$r^2$、RMSE)はどのように比較されるか?
  • RQ5体系的かつ大規模なモデルスイープは、将来の精密腫瘍学における深層学習のための実行可能で一般化可能なガイドラインを提供できるか?

主な発見

  • RNA-seq特徴量は強く冗長的かつ情報量が多く、128以上の特徴量を含むサブセットでも強い予測性能を示した。
  • 単一ヌクレオチド多型(SNP)をカウント行列として統合することで、モデル性能が著しく向上した。これはSNPが薬物反応に強く生物学的関連していることを示している。
  • MOregedとDragon7の分子記述子間に顕著な性能差は認められず、MOregedが薬物特徴抽出の代替として実用的である可能性を示した。
  • 薬物バリデーションモデルは細胞線バリデーションモデルに比べて性能が劣っており、多様で未知の薬物に対する反応を予測することは、より困難な一般化タスクであることが示された。
  • モデル全体におけるMCCおよび $r^2$ スコアの99百分位数が、ハイパーパramータチューニングを徹底せずとも達成可能な現実的で出荷時性能のベンチマークとして報告された。
  • 収束性および過学習の基準(例:TPR/FPR = 1.0、負の $r^2$)に基づくモデルフィルタリングにより、全モデルの15%(2045体)が除外され、性能比較の信頼性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。