Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluation of Various Open-Set Medical Imaging Tasks with Deep Neural Networks

Zongyuan Ge, Xin Wang|arXiv (Cornell University)|2021. 10. 21.
Artificial Intelligence in Healthcare and Education참고 문헌 38인용 수 4
한 줄 요약

이 논문은 피부과, 안과 및 영상의학 분야의 의료 영상 작업에서 도메인 간 이질성(자기 도메인, 유사 도메인, 다른 도메인) 상황을 고려해 최신의 오픈세트 인식 기법—ODIN, MC Dropout, OpenMax, OLTR—을 평가한다. ImageNet으로 사전 훈련된 모델을 사용하여 피부과, 안과 및 영상의학 데이터셋에 대해 실험한 결과, 특히 OLTR가 가장 뛰어난 정확도, 캘리브레이션, 추론 속도의 균형을 보이며 알려지지 않은 조건을 탐지하는 데서 우수한 성능을 보여, 임상 적용에 가장 적합한 것으로 나타났다.

ABSTRACT

The current generation of deep neural networks has achieved close-to-human results on "closed-set" image recognition; that is, the classes being evaluated overlap with the training classes. Many recent methods attempt to address the importance of the unknown, which are termed "open-set" recognition algorithms, try to reject unknown classes as well as maintain high recognition accuracy on known classes. However, it is still unclear how different general domain-trained open-set methods from ImageNet would perform on a different but more specific domain, such as the medical domain. Without principled and formal evaluations to measure the effectiveness of those general open-set methods, artificial intelligence (AI)-based medical diagnostics would experience ineffective adoption and increased risks of bad decision making. In this paper, we conduct rigorous evaluations amongst state-of-the-art open-set methods, exploring different open-set scenarios from "similar-domain" to "different-domain" scenarios and comparing them on various general and medical domain datasets. We summarise the results and core ideas and explain how the models react to various degrees of openness and different distributions of open classes. We show the main difference between general domain-trained and medical domain-trained open-set models with our quantitative and qualitative analysis of the results. We also identify aspects of model robustness in real clinical workflow usage according to confidence calibration and the inference efficiency.

연구 동기 및 목표

  • ImageNet에서 사전 훈련된 일반 도메인 오픈세트 인식 기법이 도메인 이질성이 존재하는 의료 영상 작업에 어떻게 적용되는지 효과를 평가하는 것.
  • 의료 영상에서 알려지지 않은 상태를 탐지하는 데 있어 불확실성 기반 기법(ODIN, MC Dropout)과 오픈세트 중심 기법(OpenMax, OLTR)의 성능을 비교하는 것.
  • 신뢰도 캘리브레이션 및 추론 효율성 측정을 통해 실제 임상 워크플로우에서의 모델 강건성을 평가하는 것.
  • 향후 의료 분야 오픈세트 연구를 위한 벤치마크를 구축하기 위해 공개된 코드, 로짓, 모델 제공

제안 방법

  • ResNet-50 기반 ImageNet 사전 훈련 모델을 피부과(ISIC), 안과(APTOS), 영상의학(NIH ChestX-ray) 데이터셋에 미세조정.
  • 의료 의사결정 지원을 위한 신뢰도 캘리브레이션 향상을 위해 온도 스케일링을 적용.
  • 네 가지 오픈세트 기법 평가: ODIN(입력 노이즈 + 온도 스케일링), MC Dropout(베이지안 불확실성 추정), OpenMax(오픈세트 리스크 모델링), OLTR(대표성 학습을 통한 오픈세트 손실).
  • 세 가지 오픈세트 시나리오 수행: 자기 도메인(훈련과 동일 도메인), 유사 도메인(예: 피부과 → 안과), 다른 도메인(예: ImageNet → 의료 영상).
  • GTX 1080Ti GPU에서 추론 속도 측정을 포함해 성능 평가: 기존 클래스 정확도, 알려지지 않은 조건 탐지 AUC, 추론 속도.
  • 신뢰도 캘리브레이션 지표(예: ECE)를 사용하고 추론 시간을 보고하여 임상 적용 가능성 평가.

실험 결과

연구 질문

  • RQ1일반 도메인 오픈세트 기법이 도메인 이질성이 존재하는 의료 영상 도메인으로 이식되었을 때 성능은 어떠한가?
  • RQ2불확실성 기반 기법과 오픈세트 중심 기법 중 어느 것이 도메인 유사도의 정도에 관계없이 알려지지 않은 의료 상태를 더 잘 탐지하는가?
  • RQ3신뢰도 캘리브레이션이 임상 의사결정 지원 시스템에서 오픈세트 예측의 신뢰성에 어떤 영향을 미치는가?
  • RQ4다양한 오픈세트 기법의 추론 효율성은 어떠한가? 실시간 임상 적용에 가장 적합한 기법은 무엇인가?
  • RQ5원천 데이터셋과 타겟 데이터셋 간의 도메인 유사도가 오픈세트 인식 성능에 얼마나 큰 영향을 미치는가?

주요 결과

  • OLTR는 세 가지 오픈세트 시나리오 전반에서 다른 모든 기법보다 알려지지 않은 조건 탐지 성능이 뛰어나, 특히 유사 도메인 및 다른 도메인 작업에서 두각을 나타냈다.
  • 오픈세트 중심 기법(OpenMax, OLTR)은 도메인 이질성 하에서 불확실성 기반 기법(ODIN, MC Dropout)보다 알려지지 않은 상태 탐지에서 유의미하게 뛰어난 성능을 보였다.
  • MC Dropout는 몬테카를로 샘플링 방식으로 인해 추론 속도가 가장 느렸으며, ODIN 대비 약 20배 느렸다. 이는 실시간 적용에 제한을 주었다.
  • ODIN은 GTX 1080Ti에서 112.3ms로 가장 빠른 추론 속도를 기록했지만, 의료 데이터에서 알려지지 않은 상태 탐지 성능은 열악했다.
  • OLTR는 탐지 성능, 캘리브레이션, 추론 속도의 균형이 가장 뛰어나 임상 적용에 가장 적합한 것으로 나타났다.
  • 온도 스케일링을 통한 신뢰도 캘리브레이션은 특히 OLTR와 OpenMax에서 모델 신뢰도를 크게 향상시켜 의료 예측에서의 잘못된 캘리브레이션을 감소시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.