Skip to main content
QUICK REVIEW

[論文レビュー] Knowledge-enhanced Visual-Language Pre-training on Chest Radiology Images

Xiaoman Zhang, Chaoyi Wu|arXiv (Cornell University)|Feb 27, 2023
COVID-19 diagnosis using AI被引用数 4
ひとこと要約

本稿では、知識グラフから得られる医療知識を統合することで、ゼロショットおよびフェイントショット診断性能を向上させる、胸部X線画像解析向けの知識強化型自己教師付き診断(KAD)という、ビジョン・ランゲージ事前学習モデルを提案する。放射線科レポートから抽出した臨床用語と関係性、およびクエリベースのトランスフォーマー(疾患クエリネットワーク)を活用することで、KADは完全に教師ありのモデルと同等のゼロショット性能を達成し、5つの病理のうち3つについて統計的に有意に、3名の専門放射線科医の平均性能を上回る。

ABSTRACT

While multi-modal foundation models pre-trained on large-scale data have been successful in natural language understanding and vision recognition, their use in medical domains is still limited due to the fine-grained nature of medical tasks and the high demand for domain knowledge. To address this challenge, we propose a novel approach called Knowledge-enhanced Auto Diagnosis (KAD) which leverages existing medical domain knowledge to guide vision-language pre-training using paired chest X-rays and radiology reports. We evaluate KAD on {four} external X-ray datasets and demonstrate that its zero-shot performance is not only comparable to that of fully-supervised models, but also superior to the average of three expert radiologists for three (out of five) pathologies with statistical significance. Moreover, when few-shot annotation is available, KAD outperforms all existing approaches in fine-tuning settings, demonstrating its potential for application in different clinical scenarios.

研究の動機と目的

  • 既存のビジョン・ランゲージモデルが、微細な診断に苦労し、ドメイン特化した知識を欠いているという限界を是正すること。
  • 知識グラフからの構造化医療知識を統合することで、胸部X線画像診断におけるゼロショットおよびフェイントショット一般化性能を向上させること。
  • 視覚的関連領域を局在化する注目マップを生成することで、モデルの解釈性を向上させること。
  • 画像とレポートのペairedデータを用いた弱教師あり事前学習により、大規模なアノテート済みデータへの依存度を低減すること。
  • 知識強化型事前学習が、微調整なしに未学習の病理に対して人間のエキスパート性能に達するか、それを上回ることを実証すること。

提案手法

  • 2段階の学習フレームワーク:まず、対照的学習を用いて医療知識グラフ上で知識エンコーダーを事前学習し、医療用語および関係性の高次元表現を学習する。
  • レポートから臨床用語および関係性を抽出する3つの手法(ヒューリスティックルール、RadGraph、GPT-3.5(ChatGPT))を用い、構造化知識入力を生成する。
  • 胸部X線特徴量と抽出された医療用語・関係性の埋め込み表現との間で画像・テキスト対照的学習を実施し、視覚的表現と知識拡張テキスト表現を整合させる。
  • 疾患名を入力として受け取り、視覚的特徴量に注目して分類確率と注目マップを出力する、クエリベースのトランスフォーマー(疾患クエリネットワーク:DQN)を訓練する。
  • 病名をクエリとしてエンコードし、関連画像領域を強調する注目マップを生成することで、事前学習済みの知識エンコーダーとDQNを用いてゼロショット推論を実行する。
  • 追加のアノテーションが利用可能な場合に、標準プロトコルに従ってフェイントショット微調整を可能にし、優れた転送性を示す。

実験結果

リサーチクエスチョン

  • RQ1既存の自己教師ありおよび教師ありモデルと比較して、知識強化型ビジョン・ランゲージ事前学習は、胸部X線画像におけるゼロショット診断性能を向上させることができるか?
  • RQ2ビジョン・ランゲージ事前学習に医療知識グラフを統合することで、希少または未学習の病理に対してより良い一般化性能が得られるか?
  • RQ3モデルの予測が、放射線科医のアノテーションと一致する注目マップを通じて解釈可能になるか?
  • RQ4複数の病理に対して、ゼロショット評価においてモデルの性能はエキスパート放射線科医の性能と比較してどうなるか?
  • RQ5知識の統合は、フェイントショット微調整の文脈において、どの程度データ効率を向上させるか?

主な発見

  • KADはPadChestにおいて、193の病理すべてで、最先端の自己教師ありモデルを統計的に有意に上回るゼロショット性能を達成した。
  • CheXpertでは、ゼロショット評価において、3名の専門放射線科医の平均性能を5つの病理のうち3つで統計的に有意に上回った。
  • フェイントショット微調整において、KADはすべての既存手法を上回り、優れた転送性とデータ効率を示した。
  • モデルが生成する注目マップは、ChestX-Det10におけるポイントゲーム評価で、放射線科医の病変アノテーションとよく一致した。
  • KADは、クロスアテンションマップを通じて、信頼性があり根拠に基づいた視覚的説明を提供し、臨床的信頼性と解釈可能性を向上させた。
  • 知識グラフ表現の統合により、特に長尾分布および希少病理に対して、モデルの一般化性能が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。