Skip to main content
QUICK REVIEW

[논문 리뷰] A clinical validation of VinDr-CXR, an AI system for detecting abnormal chest radiographs

Ngoc Huy Nguyen, Ha Q. Nguyen|arXiv (Cornell University)|2021. 04. 06.
COVID-19 diagnosis using AI참고 문헌 24인용 수 6
한 줄 요약

이 연구는 베트남의 실질적인 성지병원에서 PACS에 VinDr-CXR를 통합하여, 정상 흉부 X-레이를 감지하기 위한 AI 시스템인 VinDr-CXR의 후향적 유효성을 검증한다. 병원의 HIS에서 추출한 영상의학과 보고서와 비교하여 AI 예측 결과를 평가한 결과, F1 스코어는 0.653(95% 신뢰구간 0.635–0.671)를 기록하였으며, 실험실 외 환경에서의 높은 성능을 입증하였다. 이는 실험실 성능에서의 감소에도 불구하고 실질적인 임상 환경에서의 안정성을 보여준다.

ABSTRACT

Computer-Aided Diagnosis (CAD) systems for chest radiographs using artificial intelligence (AI) have recently shown a great potential as a second opinion for radiologists. The performances of such systems, however, were mostly evaluated on a fixed dataset in a retrospective manner and, thus, far from the real performances in clinical practice. In this work, we demonstrate a mechanism for validating an AI-based system for detecting abnormalities on X-ray scans, VinDr-CXR, at the Phu Tho General Hospital - a provincial hospital in the North of Vietnam. The AI system was directly integrated into the Picture Archiving and Communication System (PACS) of the hospital after being trained on a fixed annotated dataset from other sources. The performance of the system was prospectively measured by matching and comparing the AI results with the radiology reports of 6,285 chest X-ray examinations extracted from the Hospital Information System (HIS) over the last two months of 2020. The normal/abnormal status of a radiology report was determined by a set of rules and served as the ground truth. Our system achieves an F1 score - the harmonic average of the recall and the precision - of 0.653 (95% CI 0.635, 0.671) for detecting any abnormalities on chest X-rays. Despite a significant drop from the in-lab performance, this result establishes a high level of confidence in applying such a system in real-life situations.

연구 동기 및 목표

  • 실제 임상 환경에서 흉부 X-레이 해석을 위한 AI 기반 CAD 시스템의 실질적 성능을 평가하는 것.
  • PACS 및 HIS에 직접 통합하지 않고도 기존 병원 정보 시스템을 활용하여 AI 시스템의 후향적 유효성을 평가하는 방법을 개발하고 적용하는 것.
  • 영상의학 보고서에 기반한 템플릿 기반 규칙를 사용하여 정상/비정상 분류의 신뢰할 수 있는 기준을 설정하는 것.
  • 다양하고 캘리브레이션되지 않은 임상 데이터를 포함한 실질적이고 실험실 외 환경에서 VinDr-CXR의 일반화 능력을 평가하는 것.
  • 미래의 의료 영상 분야에서 AI 시스템의 임상 유효성 평가를 위한 기준을 제시하는 것.

제안 방법

  • VinDr-CXR 시스템은 베트남의 성지역 병원인 부 쓰오 종합병원의 영상보관 및 전송 시스템(PACS)에 직접 통합되었다.
  • 이 시스템은 2020년 11월~12월 동안 2개월 간 총 6,687건의 흉부 X-레이 검사에 대해 후향적으로 처리하여 각 검사에 대한 AI 예측을 생성하였다.
  • 병원 정보 시스템(HIS)에서 XML 파서를 사용하여 영상의학 보고서를 추출하여 총 6,687건의 보고서로 구성된 데이터셋을 구축하였다.
  • 환자 식별번호와 DICOM 속성을 기반으로 환자 ID와 DICOM 속성을 활용한 매칭 알고리즘을 적용하여 총 6,285건의 일치하는 검사가 확보되었다.
  • 영상의학 보고서에 대해 사전 정의된 용어를 포함한 템플릿 매칭 규칙을 적용하여 흉부벽, 흉막, 폐, 심장중격의 네 가지 해부학적 영역 기준으로 보고서를 정상 또는 비정상으로 분류하였다.
  • 성능 평가 시 F1 스코어는 10,000회의 부트스트랩 재표본 추출을 통해 계산되었으며, 95% 신뢰구간은 부트스트랩 분포에서 유도되었다.

실험 결과

연구 질문

  • RQ1후향적 데이터셋으로 훈련된 AI 기반 CAD 시스템이 재훈련 없이 실제 임상 환경에 도입되었을 때도 신뢰할 수 있는 성능을 유지할 수 있는가?
  • RQ2후향적 데이터셋으로 훈련된 AI 시스템의 성능이 실제 후향적, 실질적 환경에서의 성능과 비교하여 어떻게 다를까?
  • RQ3영상의학 보고서 템플릿을 사용하여 임상 유효성 평가 환경에서 정상/비정상 분류의 신뢰할 수 있는 기준을 만들 수 있는가?
  • RQ4데이터 분포의 변화와 임상적 맥락은 영상의학 분야의 AI 모델 실질적 성능에 어떤 영향을 미치는가?

주요 결과

  • VinDr-CXR 시스템은 6,285건의 일치 검사 기반으로 실제 병원 환경에서 비정상 흉부 X-레이 감지에 F1 스코어 0.653(95% 신뢰구간 0.635–0.671)를 기록하였다.
  • 이 F1 스코어는 실험실 성능인 0.831에 비해 상당한 감소를 보이며, 데이터 분포의 변화 또는 임상 맥락으로 인한 성능 격차를 시사한다.
  • 기준은 영상의학 보고서의 템플릿 매칭을 통해 설정되었으며, 정상 케이스 4,529건(72.4%)과 비정상 케이스 1,756건(27.6%)으로 구성되었다.
  • F1 스코어의 부트스트랩 분포를 활용하여 95% 신뢰구간을 계산하여 성능 평가의 통계적 정확성을 보장하였다.
  • 성능 저하가 있었음에도 불구하고 F1 스코어 0.653는 임상 적용에 높은 신뢰도를 제공하며, 이는 이전 연구에서 보고된 폐렴 감지 모델의 F1 스코어 0.435를 뛰어넘는다.
  • 본 연구는 기존 병원 IT 인프라를 활용하여 의료 영상 분야의 AI 시스템에 대한 후향적 실질적 유효성 평가를 위한 실현 가능한 프레임워크를 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.