Skip to main content
QUICK REVIEW

[논문 리뷰] Auxiliary Image Regularization for Deep CNNs with Noisy Labels

Samaneh Azadi, Jiashi Feng|arXiv (Cornell University)|2015. 11. 22.
Advanced Neural Network Applications참고 문헌 20인용 수 22
한 줄 요약

이 논문은 레이블 노이즈에 대한 강건성을 향상시키기 위해 정보가 풍부하고 깨끗한 훈련 이미지를 보조 예시로 자동으로 선택하는, 딥 컨volution 네트워크를 위한 새로운 그룹 스parser 정규화 기법인 보조 이미지 정규화(AIR)를 제안한다. 확률적 ADMM를 사용하여 특성 반응에 구조적 스퍼스리티를 강제 적용함으로써 노이즈가 있는 샘플을 억제하고, 합성 및 실제 레이블 노이즈가 있는 벤치마크 데이터셋에서 분류 정확도를 향상시킨다.

ABSTRACT

Precisely-labeled data sets with sufficient amount of samples are very important for training deep convolutional neural networks (CNNs). However, many of the available real-world data sets contain erroneously labeled samples and those errors substantially hinder the learning of very accurate CNN models. In this work, we consider the problem of training a deep CNN model for image classification with mislabeled training samples - an issue that is common in real image data sets with tags supplied by amateur users. To solve this problem, we propose an auxiliary image regularization technique, optimized by the stochastic Alternating Direction Method of Multipliers (ADMM) algorithm, that automatically exploits the mutual context information among training images and encourages the model to select reliable images to robustify the learning process. Comprehensive experiments on benchmark data sets clearly demonstrate our proposed regularized CNN model is resistant to label noise in training data.

연구 동기 및 목표

  • 레이블이 노이즈가 섞여 있는 이미지 데이터셋에서 모델 성능이 저하되는 문제를 해결하기 위해.
  • 신뢰할 수 있는 훈련 이미지를 자동으로 식별하고 보조 예시로 활용함으로써 강건성을 향상시키는 정규화 기법을 개발하기 위해.
  • 기본 데이터 만능의 구조를 활용하여 레이블 노이즈가 존재하는 상황에서도 정확한 표현을 학습할 수 있도록 하기 위해.
  • 레이블 혼동 분포에 대한 사전 지식이 필요하지 않은 확장성 있고 적응 가능한 정규화 기법을 설계하기 위해.

제안 방법

  • 모델 파라미터가 아닌 딥 컨volution 네트워크 특성의 반응 맵에 그룹 스퍼시티 정규화를 적용하는 보조 이미지 정규화 기법(AIR)을 제안한다.
  • 겹치는 그룹 노름을 사용하여 정보가 풍부한 이미지 표현을 선별하고, 노이즈가 있거나 잘못 레이블링된 예시를 억제한다.
  • 확률적 ADMM를 사용하여 정규화된 목적 함수를 최적화함으로써 대규모 데이터셋에 대한 확장성을 확보한다.
  • 다른 데이터셋에서 사전에 훈련된 딥 특징을 활용하여 정규화를 위한 데이터 만능의 구조를 정의한다.
  • CNN의 최상위 레이어에 정규화를 적용하여, 모델이 관련성 있고 깨끗한 보조 이미지에만 가중치를 두는 분류기를 학습할 수 있도록 한다.
  • 정규화 항에 그룹 샘플링을 도입하여 정확도의 큰 하락 없이 메모리 사용량을 줄인다.

실험 결과

연구 질문

  • RQ1학습 레이블이 노이즈가 있을 경우, 데이터 기반 정규화 기법이 딥 컨볼루션 네트워크의 이미지 분류 성능을 향상시킬 수 있는가?
  • RQ2그룹 스퍼스 정규화 기법이 노이즈가 있는 샘플을 억제하기 위해 신뢰할 수 있는 보조 이미지를 얼마나 효과적으로 선택할 수 있는가?
  • RQ3AIR는 합성 및 실제 레이블 노이즈에 대해 기존 표준 모델 및 기존 방법보다 강건성이 뛰어나게 성능을 높이는가?
  • RQ4정규화가 성능을 유지하면서 대규모 데이터셋에 대해 최소한의 메모리 오버헤드로 확장 가능한가?

주요 결과

  • 50%의 합성 레이블 노이즈가 있는 CIFAR-10에서, AIR는 72.3%의 테스트 정확도를 기록하여 표준 모델과 기준 방법들을 능가했다.
  • 정규화에 사용된 그룹의 1%만으로도 AIR는 메모리 비용을 크게 줄였고, 정확도는 0.5% 감소(71.8%로)하여 큰 영향을 주지 않았다.
  • NUS-WIDE-LITE에서 AIR는 SVM 및 기타 기준 방법보다 높은 평균 평균 정밀도(mAP)를 달성하여, 사용자 태그의 노이즈에 대한 뛰어난 강건성을 입증했다.
  • 시각화 결과는 AIR가 활성화 점수가 높은 깨끗한 이미지를 정확히 우선순위로 삼고, 노이즈가 있거나 잘못 레이블링된 이미지를 억제함을 확인했다.
  • 모델이 노이즈가 있는 예시를 억제하는 능력은 시각적 및 정량적 방법으로 검증되었으며, AIR가 잘못 레이블링된 훈련 샘플을 효과적으로 무시함을 보여주었다.
  • AIR는 실제 레이블 노이즈가 있는 데이터에 대해 강력한 일반화 능력을 보였으며, 레이블 혼동 패턴에 대한 사전 지식 없이도 효과적으로 작동함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.