[논문 리뷰] PARS: Pseudo-Label Aware Robust Sample Selection for Learning with Noisy Labels
PARS는 원본 노이즈 있는 레이블과 의사 레이블을 레이블 종속적 노이즈 인식 손실 함수를 통해 공동으로 활용하는 새로운 강건한 샘플 선택 프레임워크를 제안한다. 이는 모든 샘플에 대한 효과적인 자기학습을 가능하게 하면서도 노이즈 있는 레이블로의 과적합을 완화한다. 이는 상태의 기술을 초월하는 성능을 달성하며, 대칭 노이즈 비율이 90%인 CIFAR-100에서 12%p의 절대 정확도 향상을 기록하고, 자원이 제한된 환경에서는 27% 향상을 기록한다.
Acquiring accurate labels on large-scale datasets is both time consuming and expensive. To reduce the dependency of deep learning models on learning from clean labeled data, several recent research efforts are focused on learning with noisy labels. These methods typically fall into three design categories to learn a noise robust model: sample selection approaches, noise robust loss functions, or label correction methods. In this paper, we propose PARS: Pseudo-Label Aware Robust Sample Selection, a hybrid approach that combines the best from all three worlds in a joint-training framework to achieve robustness to noisy labels. Specifically, PARS exploits all training samples using both the raw/noisy labels and estimated/refurbished pseudo-labels via self-training, divides samples into an ambiguous and a noisy subset via loss analysis, and designs label-dependent noise-aware loss functions for both sets of filtered labels. Results show that PARS significantly outperforms the state of the art on extensive studies on the noisy CIFAR-10 and CIFAR-100 datasets, particularly on challenging high-noise and low-resource settings. In particular, PARS achieved an absolute 12% improvement in test accuracy on the CIFAR-100 dataset with 90% symmetric label noise, and an absolute 27% improvement in test accuracy when only 1/5 of the noisy labels are available during training as an additional restriction. On a real-world noisy dataset, Clothing1M, PARS achieves competitive results to the state of the art.
연구 동기 및 목표
- 대규모 데이터셋에서 노이즈 있는 레이블을 가진 딥 네URAL 네트워크를 훈련하는 데 도전하는 것. 이는 모델의 일반화 능력을 심각하게 떨어뜨릴 수 있다.
- 기존 방법의 한계를 극복하는 것. 기존 방법은 필터링된 노이즈 있는 샘플을 기각하거나, 레이블 보정을 위해 고품질의 검증 세트에 의존한다.
- 원본 레이블과 의사 레이블을 모두 활용하면서도 신뢰도 기반 필터링과 노이즈 인식 손실 함수를 통해 노이즈에 강건한 통합 훈련 프레임워크를 개발하는 것.
- 오직 일부 레이블만 이용 가능한 실제적인 고노이즈 및 저자원 환경에서의 성능 평가
제안 방법
- PARS는 이중 단계 훈련 프로세스를 사용한다: 첫 번째로, 모델 학습을 안정화하기 위해 노이즈에 강건한 손실 함수를 사용하는 강건한 웜업 단계를 거친다.
- 두 번째로, 데이터 증강을 통해 모든 훈련 샘플(이전에 노이즈로 간주되어 필터링된 샘플 포함)에 대해 의사 레이블을 생성하는 자기학습을 적용한다.
- 예측 신뢰도에 기반한 필터링을 수행하여 높은 임계값을 설정함으로써 신뢰할 수 있는 샘플을 식별하고, 애매한 샘플과 노이즈 있는 샘플을 구분한다.
- 원본 레이블과 의사 레이블 샘플 모두에 대해 레이블 종속적 노이즈 인식 손실 함수를 적용한다: 깨끗한 샘플에 대해서는 양성/부정성 학습을, 노이즈 있는 샘플에 대해서는 강건한/부정성 학습을 수행한다.
- 원본 데이터와 의사 레이블 데이터의 손실을 동시에 최적화하여 어떤 샘플도 기각하지 않고 신호 활용도를 극대화한다.
- 오직 일부 레이블만 이용 가능한 새로운 저자원 세미-서프비즈드 LNL 설정을 도입하여 자원 부족 조건에서도 뛰어난 성능을 입증한다.
실험 결과
연구 질문
- RQ1원본 레이블과 의사 레이블 데이터를 모두 활용하는 통합 프레임워크가 딥 러닝에서 노이즈 있는 레이블에 대한 강건성을 향상시킬 수 있는가?
- RQ2이전에 기각되었던 필터링된 노이즈 있는 샘플을 유지하고 학습함으로써 모델 성능이 향상되는가?
- RQ3제안된 레이블 종속적 노이즈 인식 손실 함수가 다양한 수준과 유형의 노이즈를 다루는 데 얼마나 효과적인가?
- RQ4실제 데이터 수집에서 흔히 볼 수 있는 고노이즈 및 저자원 설정에서도 PARS가 최고 성능을 달성할 수 있는가?
주요 결과
- CIFAR-100에서 대칭 노이즈 비율이 90%일 경우, PARS는 이전 최고 성능 기준보다 테스트 정확도에서 12%p의 절대 향상을 기록한다.
- 노이즈 있는 레이블 중 1/5만 이용 가능한 저자원 설정에서, PARS는 기존 방법 대비 테스트 정확도에서 27%p의 절대 향상을 기록한다.
- 절단 실험 결과, 의사 레이블 사용을 제거하면 성능이 크게 떨어지며, 이는 의사 레이블을 활용한 자기학습의 중요성을 입증한다.
- 필터링된 노이즈 있는 레이블을 기각하는 것(노이즈 인식 손실 함수를 사용하지 않고)은 일관되게 성능 저하를 초래하며, 모든 샘플을 유지하는 가치를 보여준다.
- 전체 PARS 모델는 모든 데이터셋과 노이즈 수준에서 모든 절단 변형보다 뛰어난 성능을 보이며, 구성 요소 간의 상호보완성을 확인한다.
- 실제 세계의 Clothing1M 데이터셋에서 PARS는 최고 성능에 경쟁 가능한 결과를 기록하며, 실세계의 노이즈 있는 데이터에 대한 일반화 능력을 입증한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.