Skip to main content
QUICK REVIEW

[논문 리뷰] Using artificial intelligence to detect chest X-rays with no significant findings in a primary health care setting in Oulu, Finland

Tommi Keski-Filppula, Marko Nikki|arXiv (Cornell University)|2022. 05. 17.
Radiomics and Machine Learning in Medical Imaging인용 수 7
한 줄 요약

이 연구는 핀란드의 주 치료 기관에서 정상(중요한 이상 소견 없음) 체胸 X-ray를 감지하기 위한 상용 AI 시스템의 성능을 평가한다. 핀란드 오우루 소재 주 치료 기관에서 9,579건의 사례를 후향적으로 분석한 결과, AI는 정상 영상의 감지에서 민감도 99.8%와 특이도 36.4%를 기록했으며, 오진으로 인한 잘못된 음성 결과는 9건에 불과했고, 이 중 치명적인 이상 소견을 포함한 경우는 없었다. 이는 높은 안전성과 주 치료 영상 진료에서 방사선 전문의의 업무 부담 감소 잠재력이 있음을 시사한다.

ABSTRACT

Objectives: To assess the use of artificial intelligence-based software in ruling out chest X-ray cases, with no significant findings in a primary health care setting. Methods: In this retrospective study, a commercially available artificial intelligence (AI) software was used to analyse 10 000 chest X-rays of Finnish primary health care patients. In studies with a mismatch between an AI normal report and the original radiologist report, a consensus read by two board-certified radiologists was conducted to make the final diagnosis. Results: After the exclusion of cases not meeting the study criteria, 9579 cases were analysed by AI. Of these cases, 4451 were considered normal in the original radiologist report and 4644 after the consensus reading. The number of cases correctly found nonsignificant by AI was 1692 (17.7% of all studies and 36.4% of studies with no significant findings). After the consensus read, there were nine confirmed false-negative studies. These studies included four cases of slightly enlarged heart size, four cases of slightly increased pulmonary opacification and one case with a small unilateral pleural effusion. This gives the AI a sensitivity of 99.8% (95% CI= 99.65-99.92) and specificity of 36.4 % (95% CI= 35.05-37.84) for recognising significant pathology on a chest X-ray. Conclusions: AI was able to correctly rule out 36.4% of chest X-rays with no significant findings of primary health care patients, with a minimal number of false negatives that would lead to effectively no compromise on patient safety. No critical findings were missed by the software.

연구 동기 및 목표

  • 주 치료 기관에서 정상 소견이 없는 흉부 X-ray를 식별하는 데 사용되는 AI 기반 소프트웨어의 성능을 평가하기 위해.
  • 정상 소견을 배제하는 데 있어 AI의 안전성과 정확도를 평가하여 심각한 병변을 놓치는 위험을 최소화하기 위해.
  • 진단 신뢰성을 평가하기 위해 AI 결과를 원래 방사선 전문의의 진단과 두 명의 자격을 갖춘 방사선 전문의가 수행한 공식 진단 결과와 비교하기 위해.
  • 실제 주 치료 환자 집단에서 정상 영상 소견을 감지하는 데 있어 AI 시스템의 민감도와 특이도를 정량화하기 위해.
  • 오진으로 인한 잘못된 음성 결과 사례를 식별하고, AI 시스템이 치명적인 병변을 놓쳤는지 평가하기 위해.

제안 방법

  • 핀란드 오우루 소재 주 치료 기관의 핀란드 환자 10,000명의 흉부 X-ray에 대한 후향적 분석.
  • 상용으로 유통되는 AI 소프트웨어를 사용하여 정의된 알고리즘에 따라 각 X-ray를 정상 또는 비정상으로 분류.
  • AI 출력 결과와 원래 방사선 전문의 보고서 간의 불일치가 발생한 사례는 두 명의 자격을 갖춘 방사선 전문의가 공식 진단을 내리기 위해 공식 독립 독해를 실시.
  • 민감도, 특이도 및 95% 신뢰구간을 사용한 통계적 분석을 통해 AI 성능 평가.
  • 데이터 품질 확보를 위해 연구 기준에 부합하지 않는 사례(예: 데이터 불완전, 진단 불가능한 영상 등)를 제외.
  • 최종 평가에서는 AI가 정상 영상 사례를 정확히 식별하고 오진으로 인한 잘못된 음성 결과를 탐지하는 능력에 집중.

실험 결과

연구 질문

  • RQ1주 치료 기관에서 정상 소견이 없는 흉부 X-ray를 감지하는 데 있어 AI 시스템의 민감도와 특이도는 얼마인가?
  • RQ2AI 시스템은 얼마나 많은 오진으로 인한 잘못된 음성 결과 사례를 생성하며, 어떤 종류의 병변이 놓쳐졌는가?
  • RQ3중요한 방사선학적 소견이 없는 상황에서 AI 시스템이 치명적 또는 생명을 위협하는 병변을 놓쳤는가?
  • RQ4원래 방사선 전문의 보고서와 두 명의 전문 방사선 전문의가 수행한 공식 독해 결과와 비교할 때 AI의 성능은 어떻게 다른가?
  • RQ5AI 시스템은 주 치료 환경에서 정상 소견을 안전하게 배제할 수 있을 정도로 얼마나 안전한가? 환자 안전을 훼손하지 않고서도.

주요 결과

  • 공식 독해 이후, AI 시스템은 정상 소견이 없는 4,644건 중 1,692건을 정확히 식별하여 민감도 99.8% (95% 신뢰구간: 99.65–99.92)를 기록했다.
  • 정상 사례를 식별하는 데 있어 특이도는 36.4% (95% 신뢰구간: 35.05–37.84)였으며, 이는 실제로 정상인 사례의 상대적으로 낮은 비율이 AI에 의해 정상으로 분류됨을 의미한다.
  • 공식 독해 이후 오진으로 인한 잘못된 음성 결과 사례는 총 9건으로 확인되었으며, 이는 심장 크기가 약간 커진 경우 4건, 폐 부위에서 약간의 투명도 증가가 있는 경우 4건, 소규모 단일 측 병변이 있는 경우 1건이었다.
  • AI에 의해 치명적 또는 생명을 위협하는 병변이 한 건도 놓치지 않았으며, 임상 스크리닝에서 높은 안전성 성능을 보였다.
  • AI 시스템은 정상 소견을 배제하는 데 있어 높은 신뢰성을 보였으며, 심각한 병변을 놓치는 위험도 최소화되었다.
  • 결과적으로 AI는 주 치료 환경에서 흉부 X-ray를 사전 선별하는 데 안전하게 활용될 수 있으며, 방사선 전문의의 업무 부담 감소와 함께 높은 진단 안전성을 유지할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.