[논문 리뷰] Robust Learning at Noisy Labeled Medical Images: Applied to Skin Lesion Classification
이 논문은 노이즈가 있는 의료 영상 레이블 하에서 강건한 피부 병변 분류를 위한 반복적 딥러닝 프레임워크를 제안한다. 온라인 불확실성 샘플 마이닝을 통해 노이즈가 있는 샘플을 억제하고, 하드 및 少수 클래스 샘플을 유지하기 위한 샘플 재가중 전략을 사용한다. 이 방법은 노이즈 분포에 대한 사전 지식이나 청소년 검증 데이터가 없이도 노이즈가 있는 피부 병변 데이터셋에서 최신 기술 수준의 성능을 달성한다.
Deep neural networks (DNNs) have achieved great success in a wide variety of medical image analysis tasks. However, these achievements indispensably rely on the accurately-annotated datasets. If with the noisy-labeled images, the training procedure will immediately encounter difficulties, leading to a suboptimal classifier. This problem is even more crucial in the medical field, given that the annotation quality requires great expertise. In this paper, we propose an effective iterative learning framework for noisy-labeled medical image classification, to combat the lacking of high quality annotated medical data. Specifically, an online uncertainty sample mining method is proposed to eliminate the disturbance from noisy-labeled images. Next, we design a sample re-weighting strategy to preserve the usefulness of correctly-labeled hard samples. Our proposed method is validated on skin lesion classification task, and achieved very promising results.
연구 동기 및 목표
- 전문 지식이 요구되는 고도의 전문성 필요로 인해 전문가의 레이블링이 오류를 일으킬 수 있는 의료 영상 데이터셋에서의 레이블 노이즈 문제를 해결하는 것.
- 학습 데이터에 잘못 레이블링된 이미지가 포함된 경우 피부 병변 분류에 대한 딥 네트워크 성능을 향상시키는 것.
- 사전 추정된 노이즈 전이 행렬이나 추가적인 청소년 레이블 데이터에 의존하지 않는 방법을 개발하는 것.
- 노이즈 레이블 조건 하에서 하드 및 소수 클래스 샘플의 유용성을 유지하는 것.
제안 방법
- 온라인 불확실성 샘플 마이닝(OUSM) 전략은 각 훈련 반복 동안 낮은 훈련 손실(낮은 불확실성)을 가진 샘플을 백프로파게이션에 선택하여, 높은 불확실성(가능성 높은 노이즈)을 가진 샘플을 효과적으로 걸러낸다.
- 샘플 재가중 모듈은 깊은 특징 기반으로 개별 샘플에 가중치를 할당하여 하드 예제와 소수 클래스 샘플을 강조함으로써 훈련 중에 그들이 묻히지 않도록 한다.
- 프레임워크는 반복적으로 훈련되며, 처음 다섯 에포크 동안 재가중 없이 훈련하여 초기 학습을 안정화시킨 후, 이후 단계에서 OUSM과 재가중을 모두 적용한다.
- 손실 함수는 재가중된 소프트맥스 손실과 온라인 불확실성 손실을 조합하며, 기울기는 오직 낮은 불확실성 샘플에 대해서만 계산된다.
- 이 방법은 엔드 투 엔드로 훈련 가능하며, 노이즈 전이 행렬의 명시적 추정이나 외부 청소년 데이터가 필요하지 않다.
- 이 방법은 SGD 최적화를 사용한 ResNet-101에 적용되며, 적응형 가중치와 배치 정규화를 사용한 교차 엔트로피 손실을 사용한다.
실험 결과
연구 질문
- RQ1노이즈 분포에 대한 사전 가정 없이도 온라인 불확실성 샘플 마이닝이 피부 병변 분류에서 노이즈 레이블의 영향을 효과적으로 억제할 수 있는가?
- RQ2노이즈가 있는 의료 데이터셋에서 하드 및 소수 클래스 샘플이 존재할 경우 개별 샘플 재가중 전략이 모델 일반화 성능에 어떻게 기여하는가?
- RQ3불확실성 마이닝과 재가중 전략을 결합했을 때 기존 방법에 비해 얼마나 더 뛰어난 성능을 내는가?
- RQ4추가 청소년 레이블 데이터나 사전 추정된 노이즈 전이 행렬이 없이도 제안된 방법이 강건한 성능을 달성할 수 있는가?
주요 결과
- 제안된 방법은 5% 노이즈 레이블 벤치마크에서 84.5%의 정확도를 달성하여 최신 기술 수준의 방법 [4]보다 1.3%p 높은 성능을 보였다.
- 10% 노이즈 수준에서 83.6%의 정확도를 기록하여 [4]를 2.3%p 초월하며, 증가하는 노이즈에 대한 강력한 내성성을 입증했다.
- 아블레이션 연구를 통해 온라인 불확실성 마이닝과 개별 재가중 전략이 성능 향상에 기여하며, 특히 하드 및 소수 클래스 샘플에 대해 재가중 전략이 매우 중요한 역할을 한다는 것이 확인되었다.
- 노이즈 데이터에서 오직 교차 엔트로피 손실만을 사용해 훈련한 모델는 10% 노이즈에서 정확도가 79.1%로 떨어졌으며, 이는 제안된 구성 요소의 필요성을 강력히 시사한다.
- 40% 노이즈 수준에서 테스트 정확도는 75.7%를 기록하여 [4]의 68.4%를 크게 뛰어넘었으며, 고노이즈 수준에 대한 강력한 내성성을 보였다.
- 결과는 DNN이 노이즈 레이블을 기억할 수 있음을 확인했지만, 제안된 프레임워크가 높은 불확실성 샘플을 걸러내고 정보가 풍부한 샘플을 유지함으로써 이를 효과적으로 완화함을 검증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.