Skip to main content
QUICK REVIEW

[論文レビュー] Machine Learning-Assisted Recurrence Prediction for Early-Stage Non-Small-Cell Lung Cancer Patients

Adrianna Janik, María Torrente|arXiv (Cornell University)|Nov 17, 2022
Radiomics and Machine Learning in Medical Imaging被引用数 11
ひとこと要約

本研究では、スペインの1,387例の患者から得られた臨床データを用いて、早期非小細胞肺がん(NSCLC)患者の再発予測を目的とした表形式およびグラフベースの機械学習モデルを開発・評価した。最も優れた性能を示したのは、表形式データを用いたランダムフォレストで、10分割交差検証にて76%の正答率を達成した。SHAPおよび例示ベースの説明により、臨床的意思決定支援のための解釈可能性が向上した。

ABSTRACT

Background: Stratifying cancer patients according to risk of relapse can personalize their care. In this work, we provide an answer to the following research question: How to utilize machine learning to estimate probability of relapse in early-stage non-small-cell lung cancer patients? Methods: For predicting relapse in 1,387 early-stage (I-II), non-small-cell lung cancer (NSCLC) patients from the Spanish Lung Cancer Group data (65.7 average age, 24.8% females, 75.2% males) we train tabular and graph machine learning models. We generate automatic explanations for the predictions of such models. For models trained on tabular data, we adopt SHAP local explanations to gauge how each patient feature contributes to the predicted outcome. We explain graph machine learning predictions with an example-based method that highlights influential past patients. Results: Machine learning models trained on tabular data exhibit a 76% accuracy for the Random Forest model at predicting relapse evaluated with a 10-fold cross-validation (model was trained 10 times with different independent sets of patients in test, train and validation sets, the reported metrics are averaged over these 10 test sets). Graph machine learning reaches 68% accuracy over a 200-patient, held-out test set, calibrated on a held-out set of 100 patients. Conclusions: Our results show that machine learning models trained on tabular and graph data can enable objective, personalised and reproducible prediction of relapse and therefore, disease outcome in patients with early-stage NSCLC. With further prospective and multisite validation, and additional radiological and molecular data, this prognostic model could potentially serve as a predictive decision support tool for deciding the use of adjuvant treatments in early-stage lung cancer. Keywords: Non-Small-Cell Lung Cancer, Tumor Recurrence Prediction, Machine Learning

研究の動機と目的

  • 従来のステージングを上回る、個別化された再発リスク予測の向上を目的とする。
  • 根治的切除後も30–55%の患者で再発率が高く、これに対する課題を解決することを目的とする。
  • 臨床データを用いた客観的で再現可能かつ解釈可能な機械学習モデルを構築し、再発予測を行うこと。
  • 表形式およびグラフベースの学習アプローチを統合し、患者レベルおよび集団レベルの複雑な関係を捉えること。
  • 個別化された再発リスクスコアを提供することで、補助療法の臨床的意思決定を支援すること。

提案手法

  • スペイン肺がんグループの胸部腫瘍登録データベースに登録された1,387例の早期NSCLC患者の臨床特徴を用いて、表形式機械学習モデル(ランダムフォレストを含む)を訓練した。
  • 表形式モデルの予測に対して、局所的で特徴レベルの説明を生成するためにSHAP(SHapley Additive exPlanations)を適用した。
  • 患者と臨床的概念を知識グラフとして表現するグラフ機械学習モデルを開発し、長距離依存関係を捉えた。
  • グラフモデルの予測を説明するために、影響力のある過去の患者を検索・比較する例示ベースの説明手法を用いた。
  • 表形式モデルには10分割交差検証を、グラフモデルには200例の保留テストセットを用い、100例のセットでキャリブレーションを実施した。
  • 時間発生までの予測ではなく、二値の再発予測(あり/なし)に焦点を当て、非がん関連死亡の混同要因を最小限に抑えた。

実験結果

リサーチクエスチョン

  • RQ1表形式臨床データを学習対象とした機械学習モデルは、標準的ステージングに比べ、早期NSCLC患者の再発予測精度を向上させることができるか?
  • RQ2多様な臨床的および集団レベルのデータを統合するグラフベースの機械学習モデルは、表形式モデルを上回る再発予測性能を示すことができるか?
  • RQ3解釈可能なAI技術を用いて、モデルの予測を解釈可能かつ臨床的行動可能にする方法は何か?
  • RQ4実世界の後向きコhortにおける早期NSCLC患者の再発予測において、解釈可能なモデルの性能はいかがなものか?
  • RQ5これらのモデルは、低リスクおよび高リスク患者における補助療法の個別化意思決定を支援できるか?

主な発見

  • 表形式データを用いたランダムフォレストモデルは、10分割交差検証で76%の正答率を達成し、優れた予測性能を示した。
  • グラフ機械学習モデルは保留テストセット(200例)で68%の正答率を記録し、表形式モデルに比べて性能が低いものの、有望な結果を示した。
  • SHAPによる説明により、個別再発リスク予測に寄与する主要な臨床的特徴が特定され、モデルの透明性が向上した。
  • 例示ベースの説明により、影響力のある歴史的患者が効果的に検索され、グラフモデル出力の解釈性が向上した。
  • モデルは1カ国(スペイン)のコhortデータを用いて訓練されたため、一般化における人口統計的制限が想定される。
  • 今後の放射線的および分子的データの統合により、モデルの性能および臨床的有用性がさらに向上すると予想される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。