Skip to main content
QUICK REVIEW

[論文レビュー] Can artificial intelligence (AI) be used to accurately detect tuberculosis (TB) from chest x-ray? A multiplatform evaluation of five AI products used for TB screening in a high TB-burden setting.

Zhi Zhen Qin, Shahriar Ahmed|arXiv (Cornell University)|Jun 9, 2020
COVID-19 diagnosis using AI被引用数 8
ひとこと要約

本研究では、バングラデシュのダッカで得られた大規模で未知のデータセットを用いて、結核(TB)検出のための5つのAIプラットフォームを評価した。すべてのAIツールが人間のレントゲン専門医を上回ったが、qXRが0.91のAUCを達成し、高負荷地域におけるAIを用いたTBスクリーニングおよびトリアージの強力な可能性を示した。

ABSTRACT

Powered by artificial intelligence (AI), particularly deep neural networks, computer aided detection (CAD) tools can be trained to recognize TB-related abnormalities on chest radiographs, thereby screening large numbers of people and reducing the pressure on healthcare professionals. Addressing the lack of studies comparing the performance of different products, we evaluated five AI software platforms specific to TB: CAD4TB (v6), InferReadDR (v2), Lunit INSIGHT for Chest Radiography (v4.9.0) , JF CXR-1 (v2) by and qXR (v3) by on an unseen dataset of chest X-rays collected in three TB screening center in Dhaka, Bangladesh. The 23,566 individuals included in the study all received a CXR read by a group of three Bangladeshi board-certified radiologists. A sample of CXRs were re-read by US board-certified radiologists. Xpert was used as the reference standard. All five AI platforms significantly outperformed the human readers. The areas under the receiver operating characteristic curves are qXR: 0.91 (95% CI:0.90-0.91), Lunit INSIGHT CXR: 0.89 (95% CI:0.88-0.89), InferReadDR: 0.85 (95% CI:0.84-0.86), JF CXR-1: 0.85 (95% CI:0.84-0.85), CAD4TB: 0.82 (95% CI:0.81-0.83). We also proposed a new analytical framework that evaluates a screening and triage test and informs threshold selection through tradeoff between cost efficiency and ability to triage. Further, we assessed the performance of the five AI algorithms across the subgroups of age, use cases, and prior TB history, and found that the threshold scores performed differently across different subgroups. The positive results of our evaluation indicate that these AI products can be useful screening and triage tools for active case finding in high TB-burden regions.

研究の動機と目的

  • 高結核負荷地域における胸部X線画像を用いた5つのAIプラットフォームのTBスクリーニング性能を比較すること。
  • 標準化された基準(Xpert)を用いて、AIツールの有効性を人間のレントゲン専門医と比較すること。
  • コスト効率とトリアージ精度の両立を図るための新しい分析フレームワークを構築・適用し、スクリーニングの閾値選定を支援すること。
  • 年齢、以前のTB歴、臨床的用途などのサブグループにおけるAIモデルの性能ばらつきを評価すること。

提案手法

  • バングラデシュのダッカに所在する3つの結核スクリーニングセンターから得た23,566枚の胸部X線画像を、CAD4TB(v6)、InferReadDR(v2)、Lunit INSIGHT(v4.9.0)、JF CXR-1(v2)、qXR(v3)の5つのAIプラットフォームで評価した。
  • TB陽性を定義するためにXpert MTB/RIF検査を基準として用い、3名のバングラデシュ公認レントゲン専門医によるコンセンサス読影を実施した。
  • 各AIモデルの性能を算出するために受信器操作特性(ROC)曲線分析を用いた。
  • コスト効率とトリアージ性能のトレードオフを評価することで、データドリブンな閾値選定を支援する新しい分析フレームワークを提案した。
  • 年齢、臨床的用途、以前のTB歴ごとのサブグループ分析を実施し、モデル性能の異質性を評価した。
  • 基準解釈の一貫性を確認するため、一部のX線画像を米国公認レントゲン専門医による再読で検証した。

実験結果

リサーチクエスチョン

  • RQ15つのAIプラットフォームは、Xpert基準と比較して胸部X線画像におけるTB検出性能でどのように差を示すか?
  • RQ2高負荷で現実の臨床環境における結核スクリーニングにおいて、AIモデルは人間のレントゲン専門医を上回る精度を示せるか?
  • RQ3年齢、以前のTB歴、臨床的用途などのサブグループにおいて、モデルの性能はどのように変動するか?
  • RQ4コスト効率と診断感度の両立を図る最適なAIベースのトリアージ閾値は何か?
  • RQ5AI支援結核スクリーニングにおける閾値選定を支援する新しい分析フレームワークを構築できるか?

主な発見

  • 5つのAIプラットフォームすべてが、胸部X線画像におけるTB検出で人間のレントゲン専門医を顕著に上回った。AUCはCAD4TBが0.82からqXRが0.91まで変動した。
  • qXRが最高の診断性能を示し、AUC 0.91(95%信頼区間:0.90–0.91)を達成した。続くのはLunit INSIGHTでAUC 0.89(95%信頼区間:0.88–0.89)であった。
  • InferReadDRとJF CXR-1はともにAUC 0.85(95%信頼区間:0.84–0.86および0.84–0.85)を達成した。
  • サブグループごとの性能に差が認められた:年齢、以前のTB歴、臨床的用途によって、閾値スコアと診断精度が顕著に異なった。
  • 提案された分析フレームワークにより、コスト効率とトリアージ性能の両立を図るデータドリブンな閾値選定が可能になった。
  • 本研究は、AIベースのスクリーニングツールが高結核負荷地域における信頼性の高いスケーラブルなトリアージソリューションとして機能できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。