Skip to main content
QUICK REVIEW

[論文レビュー] A clinical validation of VinDr-CXR, an AI system for detecting abnormal chest radiographs

Ngoc Huy Nguyen, Ha Q. Nguyen|arXiv (Cornell University)|Apr 6, 2021
COVID-19 diagnosis using AI参考文献 24被引用数 6
ひとこと要約

本研究では、ベトナムの地方病院のPACSに統合することで、VinDr-CXR(胸部X線の異常を検出するためのAIシステム)の前向き妥当性を検証した。病院のHISから抽出したレントゲン報告書と比較したAI予測のF1スコアは0.653(95%信頼区間 0.635–0.671)であった。これは、ラボ外での結果の低下にもかかわらず、実臨床環境での高い性能を示している。

ABSTRACT

Computer-Aided Diagnosis (CAD) systems for chest radiographs using artificial intelligence (AI) have recently shown a great potential as a second opinion for radiologists. The performances of such systems, however, were mostly evaluated on a fixed dataset in a retrospective manner and, thus, far from the real performances in clinical practice. In this work, we demonstrate a mechanism for validating an AI-based system for detecting abnormalities on X-ray scans, VinDr-CXR, at the Phu Tho General Hospital - a provincial hospital in the North of Vietnam. The AI system was directly integrated into the Picture Archiving and Communication System (PACS) of the hospital after being trained on a fixed annotated dataset from other sources. The performance of the system was prospectively measured by matching and comparing the AI results with the radiology reports of 6,285 chest X-ray examinations extracted from the Hospital Information System (HIS) over the last two months of 2020. The normal/abnormal status of a radiology report was determined by a set of rules and served as the ground truth. Our system achieves an F1 score - the harmonic average of the recall and the precision - of 0.653 (95% CI 0.635, 0.671) for detecting any abnormalities on chest X-rays. Despite a significant drop from the in-lab performance, this result establishes a high level of confidence in applying such a system in real-life situations.

研究の動機と目的

  • 臨床現場におけるAIベースのCADシステムが胸部X線画像を解釈する際の実世界での性能を評価すること。
  • PACSおよびHISへの直接統合を伴わずに、既存の病院情報システムを活用してAIシステムの前向き妥当性を評価する手法を開発・適用すること。
  • レントゲン報告書に対してテンプレートベースのルールを適用することで、正常/異常分類の信頼性の高い真値を確立すること。
  • 多様でキュレーションされていない臨床データを含む実臨床環境(ラボ外)におけるVinDr-CXRの汎化能力を評価すること。
  • 今後の医療画像分野におけるAIシステムの臨床的妥当性評価のベンチマークを提供すること。

提案手法

  • VinDr-CXRシステムは、ベトナムの地方病院であるフー・トウ一般病院の画像アーカイブ・コミュニケーションシステム(PACS)に直接統合された。
  • システムは2020年11月から12月の2か月間にわたり、6,687件の胸部X線画像検査を前向きに処理し、各検査についてAI予測を生成した。
  • レントゲン報告書は、病院情報システム(HIS)からXMLパーサーを用いて抽出され、6,687件の報告書からなるデータセットが作成された。
  • 患者IDおよびDICOM属性を用いたマッチングアルゴリズムにより、AI結果と対応するレントゲン報告書を関連付け、合計6,285件の一致した検査が得られた。
  • 胸部壁、胸膜、肺、縦隔の4つの解剖領域において、事前に定義されたフレーズを用いたテンプレートマッチングルールをレントゲン報告書に適用し、正常または異常と分類した。
  • 性能評価には、10,000回のブートストラップリサンプリングを用いたF1スコアが計算され、95%信頼区間はブートストラップ分布から導出された。

実験結果

リサーチクエスチョン

  • RQ1胸部X線画像解釈のためのAIベースのCADシステムは、再トレーニングを行わず、実臨床環境に導入した場合でも、信頼性のある性能を維持できるか?
  • RQ2後向きに収集されたデータセットでトレーニングされたAIシステムの性能は、前向きで実臨床環境での展開において、どのように変化するか?
  • RQ3レントゲン報告書のテンプレートを用いることで、臨床的妥当性評価の場面で、正常/異常分類の信頼性の高い真値を確立できるか、その程度はいかほどか?
  • RQ4データ分布のシフトや臨床的文脈の変化が、放射線科におけるAIモデルの実世界での性能に与える影響は何か?

主な発見

  • VinDr-CXRシステムは、6,285件の一致した検査に基づき、実病院環境で胸部X線の異常を検出する際、F1スコア0.653(95%信頼区間 0.635–0.671)を達成した。
  • F1スコアはラボ内での性能(0.831)に比べて顕著に低下しており、データ分布のシフトや臨床的文脈による性能ギャップが示唆された。
  • 真値は、レントゲン報告書に対してテンプレートマッチングを適用することで確立され、正常例が4,529件(72.4%)、異常例が1,756件(27.6%)であった。
  • F1スコアのブートストラップ分布が用いられ、95%信頼区間の信頼性の高い推定が行われた。
  • 性能の低下にもかかわらず、F1スコア0.653は、臨床現場への導入に高い信頼性を示しており、先行研究で報告された肺炎検出モデルのF1スコア0.435を上回っている。
  • 本研究は、既存の病院ITインfraを活用した、医療画像分野におけるAIシステムの前向きで実臨床環境での妥当性評価の実現可能なフレームワークを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。