Skip to main content
QUICK REVIEW

[論文レビュー] Multi-Label Generalized Zero Shot Learning for the Classification of Disease in Chest Radiographs

Nasir Hayat, Hazem Lashen|arXiv (Cornell University)|Jul 14, 2021
COVID-19 diagnosis using AI参考文献 28被引用数 7
ひとこと要約

本稿では、視覚的および意味的モodalを共有の潜在空間に統合するエンドツーエンドで学習可能なマルチラベル一般化ゼロショット学習フレームワーク、CXR-ML-GZSLを提案する。NIH Chest X-rayデータセットにおいて強力なベースラインを上回り、未学習疾患に対する頑健な一般化を示し、そのクラスのラベル付きデータを必要としない。

ABSTRACT

Despite the success of deep neural networks in chest X-ray (CXR) diagnosis, supervised learning only allows the prediction of disease classes that were seen during training. At inference, these networks cannot predict an unseen disease class. Incorporating a new class requires the collection of labeled data, which is not a trivial task, especially for less frequently-occurring diseases. As a result, it becomes inconceivable to build a model that can diagnose all possible disease classes. Here, we propose a multi-label generalized zero shot learning (CXR-ML-GZSL) network that can simultaneously predict multiple seen and unseen diseases in CXR images. Given an input image, CXR-ML-GZSL learns a visual representation guided by the input's corresponding semantics extracted from a rich medical text corpus. Towards this ambitious goal, we propose to map both visual and semantic modalities to a latent feature space using a novel learning objective. The objective ensures that (i) the most relevant labels for the query image are ranked higher than irrelevant labels, (ii) the network learns a visual representation that is aligned with its semantics in the latent feature space, and (iii) the mapped semantics preserve their original inter-class representation. The network is end-to-end trainable and requires no independent pre-training for the offline feature extractor. Experiments on the NIH Chest X-ray dataset show that our network outperforms two strong baselines in terms of recall, precision, f1 score, and area under the receiver operating characteristic curve. Our code is publicly available at: https://github.com/nyuad-cai/CXR-ML-GZSL.git

研究の動機と目的

  • ラベル付きデータが不足するため、特に希少疾患や新興疾患において未学習の疾患クラスを予測できない、教師あり深層学習モデルの限界を解消すること。
  • 複数の疾患が同時に存在する胸部X線画像におけるマルチラベル分類を可能にすること、学習時に確認されていなかった疾患も含む。
  • 事前学習済みの視覚エンコーダーを必要とせず、視覚特徴と意味的埋め込みを共有の潜在空間にマッピングするゼロショット学習フレームワークの開発。
  • 潜在空間における意味的整合性、視覚的・意味的対応関係、および意味的関係の保存を保証する新しい損失関数の設計。
  • 訓練中に未学習クラスからの補助データを一切使用しない厳密なゼロショットプロトコルを用いて、モデルの一般化能力を未学習疾患クラスに対して評価すること。

提案手法

  • モデルは視覚的特徴エンコーダーと2つのプロジェクションヘッドを用い、視覚的特徴と意味的埋め込みを共有の潜在空間にマッピングし、共同最適化を可能にする。
  • 新しい学習目的は3つの成分を統合する:関連するラベルを優先するランク損失、視覚的特徴をクラスの意味に中心に寄せる整合性損失、潜在空間における意味的構造を保存する一貫性損失。
  • 視覚エンコーダーのオフライン事前学習を必要とせず、エンドツーエンドで訓練することで、視覚的表現と意味的整合性の両方を共同最適化可能。
  • 意味的埋め込みは、文脈を捉えた豊富な医療テキストコーパスから得られ、ゼロショット一般化を支援する疾患の属性を捉える。
  • 画像特徴とクラス埋め込みの類似度スコアは、潜在空間におけるコサイン類似度を用いて同時に複数のラベルを予測する。
  • ハイパーパramータの最適化(学習率と温度パラメータγ)を含む訓練戦略であり、アブレーションスタディによりエンドツーエンド学習の有効性が確認されている。

実験結果

リサーチクエスチョン

  • RQ1マルチラベル一般化ゼロショット学習フレームワークは、未学習クラスのラベル付きデータを一切必要とせず、胸部X線画像における既知および未知の疾患を効果的に分類できるか?
  • RQ2視覚エンコーダーと意味的プロジェクタのエンドツーエンド学習は、事前学習済みの視覚エンコーダーと比較して、ゼロショット一般化性能にどのように寄与するか?
  • RQ3提案された損失関数は、潜在空間における視覚的・意味的整合性と意味的構造の保存をどの程度向上させるか?
  • RQ4厳密なゼロショット評価プロトコル(未学習クラスからの補助データなし)下でも、モデルは既知および未学習クラスの両方で高い性能を維持するか?
  • RQ5異なる既知・未学習クラスの分割に応じてモデルの性能はどのように変化するか?また、クラス分布のシフトに対してどの程度の頑健性を示すか?

主な発見

  • 提案されたCXR-ML-GZSLモデルは、NIH Chest X-rayデータセットで調和平均F1スコア0.718を達成し、すべての指標で2つの強力なベースラインを上回った。
  • 視覚エンコーダーのエンドツーエンド学習は、ImageNet(0.660)やNIHデータセット(0.681)で事前学習した場合よりも優れた性能(調和平均F1:0.718)を示した。
  • 既知クラスでは再現率0.783、未学習クラスでは適合率0.663を達成し、希少疾患や新規疾患への強い一般化能力を示した。
  • アブレーションスタディにより、損失関数の3つの成分(ランク、整合性、一貫性)をすべて含めた場合が最良の性能を示し、1つ以上の成分を欠いたバージョンよりも優れた性能を示した。
  • モデルは高いAUROC(既知クラス:0.783、未学習クラス:0.663)を維持しており、複数のラベルを同時に予測する際の性能も高く、以前に未確認の疾患クラスに対しても頑健であった。
  • 結果から、医療テキストから得た文脈を考慮した意味的表現を効果的に活用することで、未学習疾患への一般化が可能であることが示された。これは、希少疾患や新興疾患の検出における臨床応用の可能性を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。