Skip to main content
QUICK REVIEW

[논문 리뷰] Centrality and Consistency: Two-Stage Clean Samples Identification for Learning with Instance-Dependent Noisy Labels

Ganlong Zhao, Guanbin Li|arXiv (Cornell University)|2022. 07. 29.
Machine Learning and Data Classification인용 수 5
한 줄 요약

이 논문은 인스턴스 의존성 레이블 노이즈(IDN) 하에서 이미지 분류 작업에서 깨끗한 샘플을 식별하기 위한 이단계 방법을 제안한다. 클래스 불균형 문제를 다루며, 첫 번째 단계에서는 클래스 중심 근처에 위치한 쉬운 깨끗한 샘플을 식별하기 위해 엔트로피 기반 희귀 클래스 집합을 활용한 클래스 수준의 특징 클러스터링을 수행한다. 두 번째 단계에서는 결정 경계 근처에 위치한 어려운 깨끗한 샘플을 탐지하기 위해 일致성 기반 분류 헤드를 적용한다. 이 방법은 CIFAR-100과 Clothing1M에서 각각 76.08% 및 75.40%의 정확도로 최신 기술(SOTA) 성능을 달성한다.

ABSTRACT

Deep models trained with noisy labels are prone to over-fitting and struggle in generalization. Most existing solutions are based on an ideal assumption that the label noise is class-conditional, i.e., instances of the same class share the same noise model, and are independent of features. While in practice, the real-world noise patterns are usually more fine-grained as instance-dependent ones, which poses a big challenge, especially in the presence of inter-class imbalance. In this paper, we propose a two-stage clean samples identification method to address the aforementioned challenge. First, we employ a class-level feature clustering procedure for the early identification of clean samples that are near the class-wise prediction centers. Notably, we address the class imbalance problem by aggregating rare classes according to their prediction entropy. Second, for the remaining clean samples that are close to the ground truth class boundary (usually mixed with the samples with instance-dependent noises), we propose a novel consistency-based classification method that identifies them using the consistency of two classifier heads: the higher the consistency, the larger the probability that a sample is clean. Extensive experiments on several challenging benchmarks demonstrate the superior performance of our method against the state-of-the-art.

연구 동기 및 목표

  • 딥러닝에서 더 현실적이지만 더 어려운 클래스 조건부 노이즈보다 더 현실적인 인스턴스 의존성 레이블 노이즈(IDN) 문제를 다루기 위해.
  • 기존 방법들이 클래스 조건부 노이즈를 가정하고 실세계 데이터에서 특징에 따라 달라지는 노이즈를 다루지 못하는 한계를 극복하기 위해.
  • 특히 극도로 기울어진 노이즈 분포를 가진 데이터셋에서, 클래스 간 불균형이 깨끗한 샘플 식별에 미치는 영향을 완화하기 위해.
  • IDN과 클래스 불균형이 존재하는 상황에서도 정확한 깨끗한 샘플 식별을 통해 모델의 일반화 성능을 향상시키기 위해.
  • 클러스터링과 일치성 기반 분류를 융합한 격리 학습 프레임워크를 개발하여 강력한 훈련을 가능하게 하기 위해.

제안 방법

  • Stage 1에서, 단위 구면 상의 샘플 특징와 클래스 예측 중심 간 코사인 유사도를 사용하여 클래스 수준의 특징 클러스터링을 수행한다.
  • 샘플이 클래스 중심에 가까운지 여부를 이분화하기 위해 혼합 가우시안 모델(GMM)을 적용하여 중심에 가까운 샘플을 깨끗한 것으로 식별한다.
  • 클래스 불균형 문제를 해결하기 위해, 희귀 클래스를 엔트로피 기반으로 집계하여 부족한 클래스의 클러스터링 안정성을 높인다.
  • Stage 2에서는 결정 경계 근처에 위치한 어려운 깨끗한 샘플을 탐지하기 위해, 두 개의 병렬 분류기로 구성된 일치성 기반 분류 헤드를 도입한다.
  • 특징 추출기에는 일관성 있는 출력을 유도하기 위한 정규화 항을, 분류기에는 불일치를 장려하기 위한 정규화 항을 적용하여 강건성을 향상시킨다.
  • 훈련 후, 일관성 점수를 기반으로 두 번째 GMM을 사용하여 샘플을 분류하며, GMM 평균이 낮을수록 깨끗한 샘플일 가능성 높아진다.

실험 결과

연구 질문

  • RQ1인스턴스 의존성 레이블 노이즈와 클래스 불균형이 존재하는 상황에서 이단계 접근법이 깨끗한 샘플을 효과적으로 식별할 수 있는가?
  • RQ2엔트로피 기반 희귀 클래스 집합을 통한 클래스 수준의 특징 클러스터링은 불균형 데이터셋에서 깨끗한 샘플 탐지 성능을 어떻게 향상시키는가?
  • RQ3이중 분류기 헤드 간 예측 일치성이 결정 경계 근처의 어려운 깨끗한 샘플 식별에 얼마나 기여하는가?
  • RQ4실세계 노이즈 데이터셋에서 최신 기술(SOTA) 방법과 비교해 본다면, 제안된 방법은 정확도와 강건성 측면에서 어떤가?
  • RQ5일치성 기반 단계는 식별된 깨끗한 샘플 세트의 클래스 분포를 효과적으로 균형 잡는가?

주요 결과

  • 노이즈 비율이 0.6인 CIFAR-100에서, 이 방법은 76.08%의 테스트 정확도를 달성하였으며, SOTA DivideMix(75.20%)와 NGC(74.44%)를 모두 앞서나갔다.
  • 극도로 불균형한 Clothing1M 데이터셋에서, 이 방법은 75.40%의 정확도를 기록하여 DivideMix(74.26%)와 NGC(74.44%)를 초월하였다.
  • 제거 실험 결과, 두 단계 모두 기여가 크며, 전체 방법은 CIFAR-100에서 기본 CE 손실 기반 기준보다 23.72%포인트 높은 성능을 보였다.
  • 일치성 기반 분류(Stage 2)는 CIFAR-100에서 노이즈 대비 깨끗한 샘플 분류의 AUC를 0.72에서 0.85로 향상시켜 강력한 분류 능력을 입증하였다.
  • Stage 2 이후 깨끗한 샘플 세트 내 클래스 분포가 더 균형 잡혀졌으며, 특히 극단적인 경우에서 희귀 클래스 비율이 증가하고 풍부한 클래스 비율이 감소하였다.
  • 확률 밀도 함수 분석 결과, 유사도(Stage 1)와 일관성(Stage 2) 측정치 모두 깨끗한 샘플과 노이즈가 섞인 샘플을 효과적으로 분리하며, 일관된 예측은 깨끗한 샘플임을 강력하게 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.