[논문 리뷰] Improving Medical Image Classification with Label Noise Using Dual-uncertainty Estimation
이 논문은 전문가의 변동성에서 기인하는 의견 불일치 노이즈와 잘못된 진단에서 기인하는 단일 타겟 노이즈를 구분함으로써 레이블 노이즈 하에서 의료 영상 분류 성능을 향상시키기 위해 이중 불확실성 추정 프레임워크를 제안한다. 개선된 직접 불확실성 예측과 몬테카를로 드롭아웃을 사용하여 불확실성 추정을 수행하고, 정규화된 불확실성 점수를 통해 샘플을 재가중하며, 부스팅 기반 커리큘럼 학습 절차를 적용하여 피부, 전립선 및 망막 질환 데이터셋에서 최신 기술 수준의 성능을 달성하였다. 새로 공개된 다수의 안과 전문의가 참여한 주석 기반 벤치마크 데이터셋을 사용하였다.
Deep neural networks are known to be data-driven and label noise can have a marked impact on model performance. Recent studies have shown great robustness to classic image recognition even under a high noisy rate. In medical applications, learning from datasets with label noise is more challenging since medical imaging datasets tend to have asymmetric (class-dependent) noise and suffer from high observer variability. In this paper, we systematically discuss and define the two common types of label noise in medical images - disagreement label noise from inconsistency expert opinions and single-target label noise from wrong diagnosis record. We then propose an uncertainty estimation-based framework to handle these two label noise amid the medical image classification task. We design a dual-uncertainty estimation approach to measure the disagreement label noise and single-target label noise via Direct Uncertainty Prediction and Monte-Carlo-Dropout. A boosting-based curriculum training procedure is later introduced for robust learning. We demonstrate the effectiveness of our method by conducting extensive experiments on three different diseases: skin lesions, prostate cancer, and retinal diseases. We also release a large re-engineered database that consists of annotations from more than ten ophthalmologists with an unbiased golden standard dataset for evaluation and benchmarking.
연구 동기 및 목표
- 의료 영상에서 흔히 발생하는 두 가지 유형의 레이블 노이즈를 체계적으로 정의하고 해결하기: 전문가의 변동성에서 기인하는 의견 불일치 노이즈와 잘못된 진단에서 기인하는 단일 타겟 노이즈.
- annotation 불일치와 예측 신뢰도에서 유도된 불확실성 측정을 통해 노이즈가 포함된 샘플을 탐지하는 이중 불확실성 추정 프레임워크 개발.
- 불확실성 점수 기반 샘플 재가중을 통해 소수 클래스 및 어려운 샘플을 유지함으로써, 극도로 불균형한 의료 데이터셋에서 모델의 강건성 향상.
- 순차적으로 깨끗한 샘플과 재가중된 노이즈가 포함된 샘플을 데이터 기반 방식으로 학습하는 부스팅 유사 커리큘럼 학습 절차 도입.
- 미래 연구를 위해 17종의 망막 질환에 대해 10명 이상의 안과 전문의가 주석을 달아 만든 대규모 고품질 벤치마크 데이터셋 공개.
제안 방법
- 다수의 전문가 주석에서 유도된 불확실성 추정을 위해 개선된 직접 불확실성 예측(iDUP)을 사용하여 의견 불일치 노이즈를 캡처한다.
- 단일 타겟 레이블 노이즈 탐지를 위해 다수결 투표 레이블이 부여된 샘플에 대해 몬테카를로 드롭아웃(MC-Dropout)을 적용하여 예측 불확실성 추정을 수행한다.
- 정규화된 불확실성 점수를 계산하여 학습 샘플을 재가중함으로써 어려운 샘플 및 소수 클래스 샘플의 영향력을 유지한다.
- 깨끗한 샘플과 재가중된 노이즈가 포함된 샘플을 순차적으로 학습하는 데이터 기반의 부스팅 기반 커리큘럼 학습 절차를 설계한다.
- 클래스 불균형 상황에서의 학습 안정성과 성능 향상을 위해 프ocal 손실과 가중 교차 엔트로피를 통합한다.
- 세 가지 의료 영상 분류 작업에서 평가: ISIC 2019(피부 병변), Gleason 2019(전립선암), Kaggle DR+(망막 질환).
실험 결과
연구 질문
- RQ1다수의 전문가 주석에서 기인하는 의견 불일치 노이즈는 어떻게 효과적으로 모델링하고, 깨끗한 레이블과 구분할 수 있는가?
- RQ2몬테카를로 드롭아웃을 통한 예측 불확실성 추정은 의료 영상 데이터셋에서 단일 타겟 노이즈를 어느 정도 탐지할 수 있는가?
- RQ3불확실성 점수 기반 샘플 재가중은 어려운 샘플이나 소수 클래스 샘플을 제거하지 않고도 불균형한 의료 데이터셋에서 모델 성능 향상에 기여하는가?
- RQ4제안된 부스팅 기반 커리큘럼 학습 절차는 레이블 노이즈 하에서 표준 학습 방식에 비해 모델의 강건성을 어떻게 향상시키는가?
- RQ5이중 불확실성 추정 프레임워크는 실제 레이블 노이즈를 포함한 기존의 의료 영상 분류 벤치마크 작업에 어떤 영향을 미치는가?
주요 결과
- Kaggle DR+ 데이터셋에서 제안된 방법은 F1 점수 55.91을 기록하여 다수결 레이블을 사용한 베이스라인(F1: 51.05)과 원본 레이블(F1: 45.42)을 크게 초월하였다.
- ISIC 2019 데이터셋에서 제안된 방법은 F1 점수 81.01을 달성하여 최고의 베이스라인(F1: 80.09)을 능가하였으며, 레이블 노이즈 하에서도 강건성을 입증하였다.
- 제거 실험 결과, 프ocal 손실과 이중 불확실성 추정을 조합하면 약간의 성능 향상이 있었지만, 전체 프레임워크는 개별 구성 요소보다 뛰어난 성능을 보였다.
- Gleason 2019 데이터셋에서 iUOD 모듈은 η=1에서 최적 성능을 기록하여 의사 수의 변동성이 높을수록 불일치 주석을 더 잘 처리함을 시사하였다.
- 불확실성 기반 이상치 탐지(UoSL)는 잘못된 레이블이 부여된 샘플(UoSL = 0.73)을 성공적으로 식별하여 오인식된 이미지에 대한 민감도를 입증하였다.
- 시각적 차이가 미미한 인접 클래스(예: NPDRI vs. NPDRII)를 구분하는 데에는 한계가 있었으며, 이 경우 UoSL 점수는 중간 수준(0.51)을 기록하여 미세한 잘못된 주석에 대한 민감도가 감소함을 시사하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.