Skip to main content
QUICK REVIEW

[論文レビュー] Deep Learning Applied to Chest X-Rays: Exploiting and Preventing Shortcuts

Sarah Jabbour, David F. Fouhey|arXiv (Cornell University)|Sep 21, 2020
Radiomics and Machine Learning in Medical Imaging被引用数 9
ひとこと要約

この論文は、胸部X線画像における深層学習モデルが、年齢、性別、ペースメイカーの有無といった便宜的相関(スパイルス・コルレレーション)を、臨床的に関連する疾患特徴を学習する代わりに、ショートカットとして利用する仕組みを調査する。本研究では、偏りのないソースタスク(例:肺炎)で事前学習し、バイアスのあるターゲットタスク(例:虚血性心不全)で最終層のみ微調整するシンプルな転移学習手法を提案。歪んだデータにおいて、AUROCを0.66から0.84まで向上させ、一般化性能が向上した。

ABSTRACT

While deep learning has shown promise in improving the automated diagnosis of disease based on chest X-rays, deep networks may exhibit undesirable behavior related to shortcuts. This paper studies the case of spurious class skew in which patients with a particular attribute are spuriously more likely to have the outcome of interest. For instance, clinical protocols might lead to a dataset in which patients with pacemakers are disproportionately likely to have congestive heart failure. This skew can lead to models that take shortcuts by heavily relying on the biased attribute. We explore this problem across a number of attributes in the context of diagnosing the cause of acute hypoxemic respiratory failure. Applied to chest X-rays, we show that i) deep nets can accurately identify many patient attributes including sex (AUROC = 0.96) and age (AUROC >= 0.90), ii) they tend to exploit correlations between such attributes and the outcome label when learning to predict a diagnosis, leading to poor performance when such correlations do not hold in the test population (e.g., everyone in the test set is male), and iii) a simple transfer learning approach is surprisingly effective at preventing the shortcut and promoting good generalization performance. On the task of diagnosing congestive heart failure based on a set of chest X-rays skewed towards older patients (age >= 63), the proposed approach improves generalization over standard training from 0.66 (95% CI: 0.54-0.77) to 0.84 (95% CI: 0.73-0.92) AUROC. While simple, the proposed approach has the potential to improve the performance of models across populations by encouraging reliance on clinically relevant manifestations of disease, i.e., those that a clinician would use to make a diagnosis.

研究の動機と目的

  • 深層ニューラルネットワークが、年齢や性別、画像プロトコルのバイアスといった、人口統計的要因や画像プロトコルのバイアスといった便宜的相関を、胸部X線データでどのように利用するかを調査すること。
  • このようなショートカットが、属性分布が異なる新しい患者集団に適用された際のモデル一般化性能を低下させる仕組みを理解すること。
  • 偏りのないソースタスクで事前学習し、最終層のみを微調整する転移学習アプローチの有効性を評価すること。
  • データの歪みに関する事前知識がなくても、バイアスのある診断タスクにおける性能向上が可能かどうかを評価すること。

提案手法

  • 本手法は二段階の学習プロセスを採用:まず、MIMIC-CXR や CheXpert といった大規模かつ多様なデータセットを用いて、ソースタスク(例:肺炎)で深層畳み込みニューラルネットワーク(DenseNet)を事前学習する。
  • その後、ターゲット診断タスク(例:虚血性心不全)のバイアスを含む訓練データを用いて、最終層(線形分類器)のみを微調整する。
  • 本手法は、ソースタスクで学習された特徴(例:肺の浸潤や体液のパターン)が、診断間で転送可能で臨床的に関連性があると仮定している。
  • 本手法は、合成された属性(例:年齢、性別)がターゲットラベルと人工的に相関するように設定された制御されたデータ歪み条件下で評価される。
  • 性能は、属性の歪み度合いを変化させたホールドアウトテストセットにおけるAUROCで測定され、標準的なエンドツーエンド学習や他の微調整ベースラインと比較される。
  • 本手法は、複数の合成データおよび実世界の歪んだデータ分布を用いて評価され、耐性および一般化性能の妥当性が検証される。

実験結果

リサーチクエスチョン

  • RQ1深層ニューラルネットワークは、1枚の胸部X線画像から、性別(例:AUROC = 0.96)や年齢(AUROC ≥ 0.90)といった患者属性を高い精度で同定できるか?
  • RQ2患者属性と疾患ラベルの間の便宜的相関が、テストセットの属性分布がシフトした場合に、モデルの一般化性能にどのように影響を与えるか?
  • RQ3偏りのないソースタスクで事前学習し、最終層のみを微調整する転移学習アプローチが、ショートカット学習を緩和し、バイアスのある診断タスクでの性能を向上させられるか?
  • RQ4ソースタスク自体にやや強い相関がある場合(例:肺炎タスクで年齢と若干相関)、本手法の性能はデータの歪み度合いに応じてどのように変化するか?
  • RQ5本手法は、年齢、性別、画像前処理などの異なる種類のバイアスに対しても一般化可能であり、モデルの耐性を向上させるか?

主な発見

  • 深層ニューラルネットワークは、1枚の胸部X線画像から性別をAUROC = 0.96で、年齢をAUROC ≥ 0.90で識別可能であり、疾患関連以外の特徴を強く学習していることが示唆される。
  • 訓練データに便宜的相関(例:高齢者に虚血性心不全が多く見られる)が存在する場合、モデルはこれらのショートカットに依存し、相関が成り立たないテストセット(例:全員が男性)では性能が著しく低下する。
  • CHF診断のための訓練データで63歳以上が過剰に含まれる歪んだデータセットにおいて、標準的な学習手法ではAUROC 0.66(95%信頼区間:0.54–0.77)にとどまり、一般化性能が著しく低いことが示された。
  • 本研究で提案する転移学習手法(肺炎で事前学習し、最終層のみ微調整)により、AUROCが0.84(95%信頼区間:0.73–0.92)に向上し、標準的な学習法を著しく上回った。
  • ソースタスク(例:肺炎)にやや強い相関がある場合でも、本手法は有効であることが示され、現実のデータの不完全性に対しても耐性があることが示唆された。
  • 歪みが極端(例:ほぼ完全な相関)な場合、性能は低下するが、依然として標準的な学習法を上回っており、ショートカット学習の部分的緩和が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。