Skip to main content
QUICK REVIEW

[論文レビュー] The TCGA Meta-Dataset Clinical Benchmark

Mandana Samiei, Tobias Würfl|arXiv (Cornell University)|Oct 18, 2019
Radiomics and Machine Learning in Medical Imaging参考文献 18被引用数 6
ひとこと要約

本論文は、遺伝子発現データ(20,530遺伝子)を用いて、The Cancer Genome Atlas(TCGA)から抽出された174の臨床予測タスクからなるベンチマーク、TCGAメタデータセットを紹介する。このデータセットは、ゲノム分野における少数ショットマルチタスク学習を可能にする。150サンプルの分割でロジスティック回帰、1層ニューラルネットワーク、3層MLPを評価した結果、MLPが全タスク平均で最高の正答率71.19%を達成し、ロジスティック回帰およびマジョリティベースラインを上回った。

ABSTRACT

Machine learning is bringing a paradigm shift to healthcare by changing the process of disease diagnosis and prognosis in clinics and hospitals. This development equips doctors and medical staff with tools to evaluate their hypotheses and hence make more precise decisions. Although most current research in the literature seeks to develop techniques and methods for predicting one particular clinical outcome, this approach is far from the reality of clinical decision making in which you have to consider several factors simultaneously. In addition, it is difficult to follow the recent progress concretely as there is a lack of consistency in benchmark datasets and task definitions in the field of Genomics. To address the aforementioned issues, we provide a clinical Meta-Dataset derived from the publicly available data hub called The Cancer Genome Atlas Program (TCGA) that contains 174 tasks. We believe those tasks could be good proxy tasks to develop methods which can work on a few samples of gene expression data. Also, learning to predict multiple clinical variables using gene-expression data is an important task due to the variety of phenotypes in clinical problems and lack of samples for some of the rare variables. The defined tasks cover a wide range of clinical problems including predicting tumor tissue site, white cell count, histological type, family history of cancer, gender, and many others which we explain later in the paper. Each task represents an independent dataset. We use regression and neural network baselines for all the tasks using only 150 samples and compare their performance.

研究の動機と目的

  • ゲノム分野における機械学習モデルの評価に向けた、一貫性があり公開可能なベンチマークデータセットの不足を解消すること。特に臨床予測タスクに焦点を当てる。
  • 遺伝子発現データを用いて、多様な臨床アウトカムを標準化し、再現可能かつ一貫性のあるフレームワークを提供すること。
  • 関連する臨床タスクを活用することで、各タスクのサンプル数が少ない状況でも一般化性能を向上させる、少数ショットマルチタスク学習を可能にすること。
  • パニックセル臨床予測タスクの広範なセットに対して、教師ありモデルのパフォーマンスのベースラインを確立すること。

提案手法

  • TCGAメタデータセットは、174の独立した分類タスクから構成され、それぞれが臨床的表現型(例:性別、腫瘍部位、生存状態)と特定のがん種(例:BRCA、KIRP)で定義される。
  • 各タスクは、20,530遺伝子の遺伝子発現データを入力とし、150サンプルを50個の訓練データと100個のテストデータに分割する。
  • 本研究では、Torchmetaライブラリを用いたメタデータローダーを実装し、訓練および評価用のタスクを効率的にサンプリング可能にした。
  • 3つのベースラインモデルを評価した:マジョリティ分類器(ダミー)、ロジスティック回帰(ソフトマックスを用いた1層ニューラルネット)、ReLU活性化関数とAdam最適化を用いた3層MLP。
  • MLPのハイパーパramータチューニングは、ランダムシードを0から9まで変化させた10-fold交差検証設定を用い、妥当性を確保した。
  • 性能評価は、全タスクにおける正答率を用い、10回の試行の平均値をとることで分散を低減した。

実験結果

リサーチクエスチョン

  • RQ1TCGAからの臨床予測タスクを統合したベンチマークは、ゲノム分野における機械学習研究の再現性と比較可能性を向上させることができるか?
  • RQ2遺伝子発現データを用いた小規模サンプルの臨床予測タスクにおいて、異なる機械学習モデルの性能はどのように異なるか?
  • RQ3関連する臨床表現型の間でマルチタスク学習を実施することで、単一タスクのベースラインと比較してモデルの一般化性能が向上するか?
  • RQ4標準的な教師ありモデル(例:ロジスティック回帰、MLP)は、少数ショット環境下で174の多様な臨床タスクに対してどの程度のパフォーマンスを示すか?

主な発見

  • 3層MLPが全174タスクで平均正答率71.19%を達成し、ロジスティック回帰(68.78%)およびマジョリティ分類器(66.18%)を顕著に上回った。
  • ロジスティック回帰はマジョリティベースラインを上回ったが、臨床データにおける複雑な非線形相互作用を捉える能力に欠け、MLPに劣った。
  • MLPの正答率の標準偏差は14.62と最低であり、他のベースラインと比較して、多様な臨床タスクにおいてより一貫した性能を示した。
  • MLPは、遺伝子発現特徴量と臨床アウトカムの間の複雑な非線形相互作用をモデル化する能力に優れていた。
  • マジョリティ分類器は66.18%の正答率を示したが、標準偏差が16.87と高く、タスク間での性能のばらつきが顕著だった。
  • 本結果は、特にメタラーニング分野において、タスク間で共有されるインダクティブバイアスを活用することで、さらなる少数ショット一般化性能の向上が可能である強力なベースラインを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。