Skip to main content
QUICK REVIEW

[논문 리뷰] Can artificial intelligence (AI) be used to accurately detect tuberculosis (TB) from chest x-ray? A multiplatform evaluation of five AI products used for TB screening in a high TB-burden setting.

Zhi Zhen Qin, Shahriar Ahmed|arXiv (Cornell University)|2020. 06. 09.
COVID-19 diagnosis using AI인용 수 8
한 줄 요약

이 연구는 방글라데시 다카의 큰 규모이자 미리 보지 못한 데이터셋을 사용하여 흉부 X선에서 결핵(TB) 검출을 위한 다섯 가지 AI 플랫폼을 평가한다. 모든 AI 도구가 인간 영상의학 전문의보다 뛰어난 성능을 보였으며, qXR는 최고의 AUC 0.91을 기록하여 고부하 지역에서 AI가 결핵 스크리닝 및 선별에 강력한 잠재력을 지닌다는 것을 입증한다.

ABSTRACT

Powered by artificial intelligence (AI), particularly deep neural networks, computer aided detection (CAD) tools can be trained to recognize TB-related abnormalities on chest radiographs, thereby screening large numbers of people and reducing the pressure on healthcare professionals. Addressing the lack of studies comparing the performance of different products, we evaluated five AI software platforms specific to TB: CAD4TB (v6), InferReadDR (v2), Lunit INSIGHT for Chest Radiography (v4.9.0) , JF CXR-1 (v2) by and qXR (v3) by on an unseen dataset of chest X-rays collected in three TB screening center in Dhaka, Bangladesh. The 23,566 individuals included in the study all received a CXR read by a group of three Bangladeshi board-certified radiologists. A sample of CXRs were re-read by US board-certified radiologists. Xpert was used as the reference standard. All five AI platforms significantly outperformed the human readers. The areas under the receiver operating characteristic curves are qXR: 0.91 (95% CI:0.90-0.91), Lunit INSIGHT CXR: 0.89 (95% CI:0.88-0.89), InferReadDR: 0.85 (95% CI:0.84-0.86), JF CXR-1: 0.85 (95% CI:0.84-0.85), CAD4TB: 0.82 (95% CI:0.81-0.83). We also proposed a new analytical framework that evaluates a screening and triage test and informs threshold selection through tradeoff between cost efficiency and ability to triage. Further, we assessed the performance of the five AI algorithms across the subgroups of age, use cases, and prior TB history, and found that the threshold scores performed differently across different subgroups. The positive results of our evaluation indicate that these AI products can be useful screening and triage tools for active case finding in high TB-burden regions.

연구 동기 및 목표

  • 고결핵 부하 지역에서 흉부 X선을 이용한 TB 스크리닝을 위한 다섯 가지 AI 플랫폼의 진단 성능을 비교하기 위해.
  • 표준 기준(엑스퍼트)을 사용하여 인간 영상의학 전문의와의 비교를 통해 AI 도구의 효과성을 평가하기 위해.
  • 비용 효율성과 선별 정확도의 균형을 고려한 선별 임계값 선택을 위한 새로운 분석 프레임워크를 개발하고 적용하기 위해.
  • 연령, 이전 결핵 병력, 임상 적용 사례와 같은 하위 집단에서 AI 모델의 성능 변동성을 평가하기 위해.

제안 방법

  • 방글라데시 다카의 세 곳의 결핵 스크리닝 센터에서 수집한 23,566장의 흉부 X선 영상에 대해 다섯 가지 AI 플랫폼—CAD4TB(v6), InferReadDR(v2), Lunit INSIGHT(v4.9.0), JF CXR-1(v2), qXR(v3)—를 평가하였다.
  • TB 양성 여부를 정의하기 위해 Xpert MTB/RIF 검사를 기준 기준으로 사용하였으며, 세 명의 방글라데시 국적 영상의학 전문의의 공식 판독을 통해 확인하였다.
  • 각 AI 모델의 성능를 평가하기 위해 수신기 작동 특성(ROC) 곡선 분석을 사용하여 AUC를 계산하였다.
  • 비용 효율성과 선별 성능 간의 상충 관계를 평가하여, 비용 효율성과 선별 정확도를 균형 잡는 데 도움이 되는 새로운 분석 프레임워크를 제안하였다.
  • 모델 성능 이질성 평가를 위해 연령, 임상 적용 사례, 이전 결핵 병력에 따른 하위집단 분석을 수행하였다.
  • 기준 해석 일관성을 확보하기 위해 일부 X선 영상에 대해 미국 국적 영상의학 전문의의 재판독을 수행하였다.

실험 결과

연구 질문

  • RQ1다섯 가지 AI 플랫폼은 Xpert 기준 기준에 비해 흉부 X선에서의 결핵 검출 능력에서 어떻게 비교되는가?
  • RQ2실제 임상 환경에서 고부하 지역에서 AI 모델이 인간 영상의학 전문의보다 결핵 스크리닝 정확도에서 뛰어나게 작용할 수 있는가?
  • RQ3연령, 이전 결핵 병력, 임상 적용 사례와 같은 하위 집단에서 모델 성능은 어떻게 변화하는가?
  • RQ4비용 효율성과 진단 민감도 사이의 균형을 고려할 때, AI 기반 선별에 가장 적합한 임계값은 무엇인가?
  • RQ5AI 보조 결핵 스크리닝에서 임계값 선택을 안내할 수 있는 새로운 분석 프레임워크를 개발할 수 있는가?

주요 결과

  • 모든 다섯 가지 AI 플랫폼이 인간 영상의학 전문의보다 흉부 X선에서의 결핵 검출 능력에서 뚜렷이 뛰어났으며, AUC는 CAD4TB의 0.82에서 qXR의 0.91까지 다양했다.
  • qXR는 AUC 0.91(95% CI: 0.90–0.91)로 가장 높은 진단 성능를 기록하였고, 이어 Lunit INSIGHT(AUC 0.89; 95% CI: 0.88–0.89)가 뒤를 이었다.
  • InferReadDR와 JF CXR-1은 각각 AUC 0.85(95% CI: 0.84–0.86 및 0.84–0.85)를 기록하였다.
  • 성능는 하위 집단 간에 다소 차이가 있었으며, 연령, 이전 결핵 병력, 임상 적용 사례에 따라 임계값 점수와 진단 정확도가 유의미하게 달라졌다.
  • 제안된 분석 프레임워크는 비용 효율성과 선별 성능를 균형 잡는 데 기초한 데이터 기반의 임계값 선택을 가능케 하였다.
  • 본 연구는 AI 기반 스크리닝 도구가 고결핵 부하 지역에서 신뢰할 수 있고 확장 가능한 선별 솔루션으로 기능할 수 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.