Skip to main content
QUICK REVIEW

[논문 리뷰] Self-Filtering: A Noise-Aware Sample Selection for Label Noise with Confidence Penalization

Qi Wei, Haoliang Sun|arXiv (Cornell University)|2022. 08. 24.
Machine Learning and Data Classification인용 수 5
한 줄 요약

이 논문은 레이블 노이즈 학습을 위한 노이즈 인식 샘플 선택 방법인 Self-Filtering(SFT)을 제안한다. SFT는 이력 모델 예측의 변동성을 이용해 노이즈가 있는 샘플을 식별하고 제거하면서 경계 예제를 유지한다. 예측 추적을 위한 메모리 백과 신뢰도 처벌 정규화를 결합함으로써, 다양한 노이즈 유형 하에서 여러 벤치마크에서 최신 기술 성능(SOTA)을 달성하며, 강건성과 일반화 능력을 크게 향상시킨다.

ABSTRACT

Sample selection is an effective strategy to mitigate the effect of label noise in robust learning. Typical strategies commonly apply the small-loss criterion to identify clean samples. However, those samples lying around the decision boundary with large losses usually entangle with noisy examples, which would be discarded with this criterion, leading to the heavy degeneration of the generalization performance. In this paper, we propose a novel selection strategy, extbf{S}elf- extbf{F}il extbf{t}ering (SFT), that utilizes the fluctuation of noisy examples in historical predictions to filter them, which can avoid the selection bias of the small-loss criterion for the boundary examples. Specifically, we introduce a memory bank module that stores the historical predictions of each example and dynamically updates to support the selection for the subsequent learning iteration. Besides, to reduce the accumulated error of the sample selection bias of SFT, we devise a regularization term to penalize the confident output distribution. By increasing the weight of the misclassified categories with this term, the loss function is robust to label noise in mild conditions. We conduct extensive experiments on three benchmarks with variant noise types and achieve the new state-of-the-art. Ablation studies and further analysis verify the virtue of SFT for sample selection in robust learning.

연구 동기 및 목표

  • 작은 손실 기반 샘플 선택의 한계를 해결한다. 이는 고손실로 인해 경계 예제가 제거되고 선택 편향이 발생하기 때문이다.
  • 기존 방법에서 고정된 손실 임계값의 민감도 및 확장성 문제를 해결한다.
  • 결정 경계 학습에 핵심적인 경계 샘플을 유지함으로써 모델의 일반화 능력을 향상시킨다.
  • 반복 학습 중 누적 선택 편향을 줄이기 위해 신뢰도 처벌 정규화 항을 도입한다.
  • 다양한 노이즈 설정과 학습 철학(예: 준지도 학습 포함)에서 프레임워크의 효과성과 유연성을 입증한다.

제안 방법

  • 각 훈련 샘플의 이력 예측을 저장하는 메모리 백 모듈을 도입한다.
  • 변동성 기준을 정의한다: 연속적인 훈련 단계에서 예측이 정확하고 오류 예측을 왔다 갔다 하면, 그 샘플을 노이즈가 있는 것으로 표시한다.
  • 노이즈 샘플은 빈번한 전환, 청소년 샘플은 안정적인 예측을 보이므로, 이를 기반으로 샘플 선택을 수행한다.
  • 학습 중 동적으로 메모리 백을 업데이트하여 다음 반복에서 지속적인 선택을 지원한다.
  • 오분류된 클래스에 대한 손실 가중치를 증가시키는 신뢰도 처벌 정규화 항을 설계하여 과신을 줄이고 선택 편향을 완화한다.
  • 준지도 학습에 FixMatch를 통합하여, 미분류된 레이블 없음 샘플과 기각된 노이즈 샘플을 활용해 성능을 추가로 향상시킨다.

실험 결과

연구 질문

  • RQ1이력 예측의 변동성이 경계 예제를 포함한 청소년 샘플과 노이즈 샘플을 신뢰성 있게 구분할 수 있는가? 특히 작은 손실 기준에 의해 자주 기각되는 경계 예제에 대해 어떻게 되는가?
  • RQ2기존의 작은 손실 또는 투표 기반 선택과 비교할 때, 제안된 변동성 기반 선택 전략은 경계 샘플을 얼마나 잘 유지하고 일반화 능력을 향상시키는가?
  • RQ3반복 학습 중 레이블 노이즈가 있는 상황에서, 신뢰도 처벌이 선택 편향 누적을 어느 정도 줄이는가?
  • RQ4다양한 노이즈 유형(대칭, 비대칭)과 노이즈 비율에서 Self-Filtering 프레임워크의 강건성은 어느 정도인가?
  • RQ5이미 존재하는 준지도 학습 방법과 효과적으로 통합되어 노이즈가 있는 데이터셋에서 성능을 추가로 향상시킬 수 있는가?

주요 결과

  • SFT는 대칭 노이즈 비율 40%인 CIFAR-10에서 92.15%의 테스트 정확도를 기록하여 기존 방법을 초월하는 최신 기술 성능을 달성한다.
  • 대칭 노이즈 비율 40%인 CIFAR-100에서도 SFT는 69.34%의 테스트 정확도를 기록하며 고노이즈 수준에서도 강력한 강건성을 입증한다.
  • 제거 실험 결과, 신뢰도 처벌 항을 제거하면 평균 3.72%의 테스트 정확도 감소가 발생하여, 이는 선택 편향 완화에 기여하는 바를 확인한다.
  • 다수결 투표 대비 변동성 기준을 사용할 경우 샘플 선택의 F-스코어가 크게 향상되어 청소년 샘플의 정확한 식별 능력 향상을 보여준다.
  • 선택된 훈련 서브셋 크기가 실제 청소년 샘플 수에 매우 가까워졌으며, 그림 10에서 선택된 집합 크기가 수평 기준선에 가까워짐을 통해 이를 확인할 수 있다.
  • 최적의 메모리 백 크기는 T=3이며, 이보다 더 큰 크기는 경계 샘플의 과다 필터링으로 인해 성능 저하를 초래하므로, 제안된 설계 선택이 실험적으로 검증된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.