Skip to main content
QUICK REVIEW

[論文レビュー] Deep Mining External Imperfect Data for Chest X-ray Disease Screening

Luyang Luo, Lequan Yu|arXiv (Cornell University)|Jun 6, 2020
COVID-19 diagnosis using AI参考文献 54被引用数 7
ひとこと要約

本論文は、複数の不完全な外部データセットを共同で学習することで、胸部X線画像の疾患分類を向上させるための新規フレームワークを提案する。ドメインおよびラベルの不一致を、タスク固有の敵対的訓練と不確実性を考慮した時系列アンサンブルによって解決する。NIHテストセットにおいて0.8349のAUCを達成し、大規模で多様な医療画像データからの優れた知識抽出を示している。

ABSTRACT

Deep learning approaches have demonstrated remarkable progress in automatic Chest X-ray analysis. The data-driven feature of deep models requires training data to cover a large distribution. Therefore, it is substantial to integrate knowledge from multiple datasets, especially for medical images. However, learning a disease classification model with extra Chest X-ray (CXR) data is yet challenging. Recent researches have demonstrated that performance bottleneck exists in joint training on different CXR datasets, and few made efforts to address the obstacle. In this paper, we argue that incorporating an external CXR dataset leads to imperfect training data, which raises the challenges. Specifically, the imperfect data is in two folds: domain discrepancy, as the image appearances vary across datasets; and label discrepancy, as different datasets are partially labeled. To this end, we formulate the multi-label thoracic disease classification problem as weighted independent binary tasks according to the categories. For common categories shared across domains, we adopt task-specific adversarial training to alleviate the feature differences. For categories existing in a single dataset, we present uncertainty-aware temporal ensembling of model predictions to mine the information from the missing labels further. In this way, our framework simultaneously models and tackles the domain and label discrepancies, enabling superior knowledge mining ability. We conduct extensive experiments on three datasets with more than 360,000 Chest X-ray images. Our method outperforms other competing models and sets state-of-the-art performance on the official NIH test set with 0.8349 AUC, demonstrating its effectiveness of utilizing the external dataset to improve the internal classification.

研究の動機と目的

  • 複数のソースからの不完全で多様な胸部X線画像データセット上で深層学習モデルを学習するという課題に対処すること。
  • 異なる撮影プロトコル、視野、前処理によるデータセット間の差異に起因するドメインの不一致を克服すること。
  • ラベルの不一致(部分的なラベリングや、データセット間での病理的カテゴリーのばらつき)を処理すること。
  • 外部の不完全なデータから効果的に知識を抽出することで、内部データセットにおける分類性能を向上させること。
  • 医療画像解析におけるマルチサイト・マルチデータセット学習のための汎用性の高いフレームワークを開発すること。

提案手法

  • クラスの不均衡と部分的なラベリングに対処するため、多ラベル胸部疾患分類を重み付き独立二値分類タスクとして定式化する。
  • 共通のカテゴリーを共有する複数のデータセット間でドメイン不変特徴を学習するため、タスク固有の敵対的訓練を適用する。
  • 単一データセットでのみラベリングされたカテゴリの潜在的知識を段階的に抽出するため、不確実性を考慮した時系列アンサンブルを導入する。
  • 共同最適化のための三モジュールフレームワーク(タスク固有の重み付け(TW)、タスク固有の敵対的訓練(TAT)、不確実性を考慮した時系列アンサンブル(UTE))を採用する。
  • 予測の不確実性推定を用いて、時間経過に伴うモデル出力を活用し、欠落ラベルの学習を安定化・向上させる。
  • 教師あり損失、敵対的損失、一貫性損失の組み合わせにより、エンドツーエンドで学習することで、ロバストネスと一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1顕著なドメインおよびラベルの不一致を示す外部胸部X線データセットを、内部モデルの性能向上に効果的に統合する方法は何か?
  • RQ2撮影プロトコル、視野、前処理の差異に起因するドメインシフトを緩和するための技術は何か?
  • RQ3一部のカテゴリーが特定のデータセットに欠落している部分的にラベリングされたデータから、信頼性高く知識を抽出する方法は何か?
  • RQ4不確実性を考慮した時系列アンサンブルは、外部データセットにおける未学習または希少にラベルが付与された病理像の学習を改善できるか?
  • RQ5複数の不完全なデータセットを組み合わせることで、マルチサイト医療画像分類におけるモデルの一般化性能と性能に及ぼす影響は何か?

主な発見

  • 提案手法は、NIHテストセットでSOTAのAUC 0.8349を達成し、既存のモデルを上回った。
  • NIHクリーンサブセットでは、TenCropテストを用いて気胸のAUCが0.925に達し、より大きな再ラベリング済みデータセットで学習したモデルに近い性能を示した。
  • ラベルノイズに対して頑健であり、複数の病理的カテゴリーにわたり一貫した性能向上を示した。
  • CheXpert や MIMIC-CXR などの外部データセットと共同で学習させた結果、NIHでの平均AUCは0.8353に達し、追加データによる性能向上の飽和点に近い可能性を示唆した。
  • タスク固有の敵対的訓練により、共通カテゴリーにおけるドメインシフトが顕著に低減され、複数のデータセット間での特徴の整合性が向上した。
  • 不確実性を考慮した時系列アンサンブルは、特に希少またはデータセット固有の病理像に対する欠落ラベルからの知識抽出を効果的に実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。