Skip to main content
QUICK REVIEW

[논문 리뷰] Deep-learning models in medical image analysis: Detection of esophagitis from the Kvasir Dataset

Kyoka Yoshiok, Kensuke Tanioka|arXiv (Cornell University)|2023. 01. 06.
Esophageal Cancer Research and Treatment인용 수 4
한 줄 요약

이 연구는 Kvasir 데이터셋의 내 endoscopic 영상에서 식도염을 진단하기 위해 GoogLeNet, ResNet-50, MobileNet V2 및 MobileNet V3의 네 가지 딥러닝 모델을 평가한다. GoogLeNet는 가장 높은 F1-스코어(0.843)를 기록했고, MobileNet V3는 가장 높은 정확도(0.950)와 정밀도(0.901)를 기록하여 식도염 진단에서 높은 확신과 정확도를 보였다. Grad-CAM 및 SHAP과 같은 설명 가능성 기법들은 모델이 임상적으로 관련 있는 점막 찢어짐에 주목하고 있음을 확인했다.

ABSTRACT

Early detection of esophagitis is important because this condition can progress to cancer if left untreated. However, the accuracies of different deep learning models in detecting esophagitis have yet to be compared. Thus, this study aimed to compare the accuracies of convolutional neural network models (GoogLeNet, ResNet-50, MobileNet V2, and MobileNet V3) in detecting esophagitis from the open Kvasir dataset of endoscopic images. Results showed that among the models, GoogLeNet achieved the highest F1-scores. Based on the average of true positive rate, MobileNet V3 predicted esophagitis more confidently than the other models. The results obtained using the models were also compared with those obtained using SHapley Additive exPlanations and Gradient-weighted Class Activation Mapping.

연구 동기 및 목표

  • 네 가지 최신 기술의 CNN 모델(GoogLeNet, ResNet-50, MobileNet V2, MobileNet V3)이 내 endoscopic 영상에서 식도염을 진단하는 정확도를 비교하기 위해.
  • 공개된 Kvasir 데이터셋을 사용하여 표준 평가 지표(정확도, 정밀도, 재현율, F1-스코어)를 통해 모델 성능을 평가하기 위해.
  • Grad-CAM 및 SHAP를 활용하여 모델의 해석 가능성 분석을 수행하여, 점막 찢어짐과 같은 임상적으로 관련 있는 특징에 모델이 집중하는지 평가하기 위해.
  • 식도염 진단에서 정확도, 계산 효율성, 임상적 확신의 균형을 가장 잘 만족하는 모델을 규명하기 위해.

제안 방법

  • GoogLeNet, ResNet-50, MobileNet V2 및 MobileNet V3의 네 가지 사전 훈련된 CNN 모델을 Kvasir 내 endoscopic 영상 데이터셋에 대해 훈련하여 식도염 대비 z-line을 이진 분류하기 위해.
  • 혼동 행렬의 값(TP, FP, TN, FN)에서 유도된 표준 평가 지표인 정확도, 정밀도, 재현율, 특이도 및 F1-스코어를 사용하여 성능 평가를 수행함.
  • 분류 결정에 가장 영향을 미치는 영역을 강조하기 위해 Grad-CAM을 적용하여 주의 맵을 시각화함.
  • 특징 수준의 기여도를 계산하기 위해 SHAP를 활용하여, 어떤 영상 패치가 식도염 예측를 지지하거나 기각하는지 식별함.
  • 모델 예측 결과를 진정된 레이블과 비교하고, 오답 예측의 원인 분석을 통해 모델의 신뢰성과 해석 가능성 평가함.
  • 모델의 예측 일관성을 평가하기 위해 테스트 이미지 전체에 걸쳐 평균 진정 양성률을 통해 모델의 신뢰도를 평가함.

실험 결과

연구 질문

  • RQ1Kvasir 데이터셋의 내 endoscopic 영상에서 식도염을 진단하는 데 있어 어떤 딥러닝 모델이 가장 높은 F1-스코어를 기록하는가?
  • RQ2MobileNet V3의 정밀도와 진정 양성률은 다른 모델들과 비교하여 어떻게 다른가?
  • RQ3Grad-CAM과 SHAP는 모델의 의사결정 과정을 어느 정도 설명할 수 있으며, 어느 방법이 임상적으로 관련 있는 특징을 더 잘 국소화하는가?
  • RQ4정확한 진단이 요구되는 바와 같이, 모델들은 z-line에 비해 점막 찢어짐과 같은 해부학적 특징에 주목하는가?

주요 결과

  • GoogLeNet는 모든 모델 중에서 가장 높은 F1-스코어 0.843을 기록하여 정밀도와 재현율의 균형이 가장 우수함을 나타냄.
  • MobileNet V3는 평균 진정 양성률 0.950을 기록하여 식도염 진단에 가장 확신 있는 성능을 보임.
  • MobileNet V3는 정밀도(0.901)와 특이도(0.908)도 가장 높게 기록하여 양성 예측의 신뢰성이 매우 높음을 나타냄.
  • SHAP 분석 결과, MobileNet V3는 특히 고신뢰도 예측에서 Grad-CAM보다 더 정확하게 다수의 점막 찢어짐을 식별함.
  • 오답 예측 케이스에서 SHAP는 염증 영역이 z-line 예측에 부정적 기여 요소로 올바르게 강조함을 보여주어, 오진에도 불구하고 질병 특징을 인지하고 있음을 시사함.
  • Grad-CAM는 오답 예측 케이스에서 기울기 포화 현상이 발생하여 분포가 넓어지고 해석 가능성 저하가 발생한 반면, SHAP는 더 나은 해석성을 유지함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.