Skip to main content
QUICK REVIEW

[논문 리뷰] Exploration of Interpretability Techniques for Deep COVID-19 Classification using Chest X-ray Images

Soumick Chatterjee, Fatima Saad|arXiv (Cornell University)|2020. 06. 03.
COVID-19 diagnosis using AI인용 수 11
한 줄 요약

이 연구는 흉부 X-ray 영상과 함께 코로나19, 폐렴 및 건강한 환자에 대한 다중 레이블 분류를 위한 딥러닝 모델(ResNet18, ResNet34, InceptionV3, InceptionResNetV2, DenseNet161)과 그 앙상블을 평가하며, 다양한 해석 가능성 기법을 활용한다. 앙상블 모델은 마이크로-F1 스코어 0.89를 기록했으며, ResNet 모델은 폐 내 생물학적으로 관련성이 있는 영역에 집중함으로써 뛰어난 해석 가능성과 함께 특징을 보였다.

ABSTRACT

The outbreak of COVID-19 has shocked the entire world with its fairly rapid spread and has challenged different sectors. One of the most effective ways to limit its spread is the early and accurate diagnosing infected patients. Medical imaging, such as X-ray and Computed Tomography (CT), combined with the potential of Artificial Intelligence (AI), plays an essential role in supporting medical personnel in the diagnosis process. Thus, in this article five different deep learning models (ResNet18, ResNet34, InceptionV3, InceptionResNetV2 and DenseNet161) and their ensemble, using majority voting have been used to classify COVID-19, pneumoniæ and healthy subjects using chest X-ray images. Multilabel classification was performed to predict multiple pathologies for each patient, if present. Firstly, the interpretability of each of the networks was thoroughly studied using local interpretability methods - occlusion, saliency, input X gradient, guided backpropagation, integrated gradients, and DeepLIFT, and using a global technique - neuron activation profiles. The mean Micro-F1 score of the models for COVID-19 classifications ranges from 0.66 to 0.875, and is 0.89 for the ensemble of the network models. The qualitative results showed that the ResNets were the most interpretable models. This research demonstrates the importance of using interpretability methods to compare different models before making a decision regarding the best performing model.

연구 동기 및 목표

  • 흉부 X-ray 영상과 함께 코로나19, 폐렴 및 건강한 환자에 대한 다중 레이블 분류를 위한 딥러닝 모델을 개발하고 평가하는 것.
  • 현장 및 글로벌 설명 가능성 방법을 활용해 모델의 해석 가능성 수준을 평가하여 임상적 신뢰도 및 의사결정 지원을 향상시키는 것.
  • ResNet, Inception, DenseNet 등의 다양한 아키텍처의 성능 및 해석 가능성 수준을 비교하여 다중 병변 탐지 능력을 평가하는 것.
  • 다수결 투표 방식을 활용한 모델 앙상블가 개선된 분류 정확도 및 일반화 능력을 제공하는지 조사하는 것.
  • 시각적 주의 영역 및 활성화 패턴을 기반으로 임상 현장에 도입하기에 가장 해석 가능하고 신뢰할 수 있는 모델을 식별하는 것.

제안 방법

  • COVID-19 및 폐렴 영상이 포함된 다중 레이블 흉부 X-ray 데이터셋에 대해 사전 학습된 다섯 가지 딥러닝 모델(ResNet18, ResNet34, InceptionV3, InceptionResNetV2, DenseNet161)을 미세조정하였다.
  • 입력 영상의 주의 영역을 시각화하기 위해 오클루전, 시냅스 지도, 입력 X 기울기, 가속화된 역전파, 통합 기울기, DeepLIFT 등의 局부 해석 가능성 기법을 적용하였다.
  • 신경망의 각 레이어에서의 특징 학습 패턴을 분석하기 위해 뉴런 활성화 프로파일을 활용해 글로벌 해석 가능성 수준을 평가하였다.
  • 다섯 개의 모델 간 다수결 투표 방식을 활용해 앙상블 모델을 구축하여 분류 성능 향상 및 개별 모델의 약점을 보완하였다.
  • 의료 전문가의 참여를 통해 주의 지도의 정성적 분석을 수행하여 주의 영역의 생물학적 관련성을 검증하였다.
  • 데이터셋은 공개 레포지터리에서 확보되었으며, Cohen 등이 제공한 코로나19 X-ray 영상과 Mooney의 데이터셋에서 확보한 폐렴 X-ray 영상이 포함되었다.

실험 결과

연구 질문

  • RQ1어느 딥러닝 아키텍처가 흉부 X-ray 영상과 함께 코로나19, 폐렴 및 건강한 환자에 대한 다중 레이블 분류에서 가장 우수한 성능을 보이는가?
  • RQ2다양한 局부 및 글로벌 해석 가능성 기법은 의료 영상 분석에서 딥러닝 모델의 의사결정 과정을 얼마나 잘 드러내는가?
  • RQ3모델의 주의 지도가 폐 및 기저귀 혼탁도와 같은 방사선학적으로 관련성이 있는 영역과 얼마나 일치하는가?
  • RQ4다수결 투표 방식을 활용한 모델 앙상블은 개별 모델 대비 분류 성능 및 내성 강도를 향상시키는가?
  • RQ5DenseNet161과 같은 일부 모델은 높은 정확도를 보이지만 해석 가능성은 낮은 이유는 무엇이며, 이는 모델 복잡도와 일반화 능력에 어떤 함의를 갖는가?

주요 결과

  • 앙상블 모델은 마이크로-F1 스코어 0.89를 기록하여 개별 모델(0.66~0.875)을 모두 초월했다.
  • ResNet18 및 ResNet34는 해석 가능성 수준이 뛰어나 주의 지도가 항상 해부학적으로 관련성이 있는 폐 영역에 집중되었다.
  • DenseNet161는 가장 높은 분류 성능를 기록했지만 생물학적으로 관련성이 없는 영역에 주의를 기울였으며, 이는 과적합 또는 높은 모델 복잡도 때문일 수 있다.
  • Dead 뉴런 수가 가장 많은 모델은 DenseNet161였으며, 이는 주어진 과제에 대해 과다 매개변수화되었을 가능성을 시사한다.
  • 해석 가능성 분석 결과, ResNet은 InceptionResNetV2와 같은 더 깊은 모델보다 더 신뢰할 수 있고 임상적으로 타당한 주의 패턴을 보였다.
  • 본 연구는 해석 가능성 수준이 모델 선택에 매우 중요하며, 높은 정확도만으로는 임상적 신뢰성이나 생물학적 타당성을 보장하지 못한다는 점을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.