Skip to main content
QUICK REVIEW

[논문 리뷰] Understanding and Mitigating the Label Noise in Pre-training on Downstream Tasks

Hao Chen, Jindong Wang|arXiv (Cornell University)|2023. 09. 29.
Aerospace and Aviation Technology인용 수 4
한 줄 요약

이 논문은 사전 훈련 데이터셋의 레이블 노이즈가 미치는 영향을 다운스트림 전이 성능에 대해 조사하며, 약간의 노이즈는 도메인 내 일반화를 향상시킬 수 있지만, 특성 공간이 왜곡되면서 항상 도메인 외 성능을 떨어뜨린다는 것을 밝혀냈다. 이를 완화하기 위해 저자는 NMTune을 제안한다. NMTune은 공분산과 특이값 정규화를 사용하여 특성 공간을 애핀 변환하는 경량 블랙박스 튜닝 방법으로, 전체 미세조정 없이 도메인 내 및 도메인 외 작업 모두에서 일반화 성능을 크게 향상시킨다.

ABSTRACT

Pre-training on large-scale datasets and then fine-tuning on downstream tasks have become a standard practice in deep learning. However, pre-training data often contain label noise that may adversely affect the generalization of the model. This paper aims to understand the nature of noise in pre-training datasets and to mitigate its impact on downstream tasks. More specifically, through extensive experiments of supervised pre-training models on synthetic noisy ImageNet-1K and YFCC15M datasets, we demonstrate that while slight noise in pre-training can benefit in-domain (ID) transfer performance, where the training and testing data share the same distribution, it always deteriorates out-of-domain (OOD) performance, where training and testing data distribution are different. We empirically verify that the reason behind is noise in pre-training shapes the feature space differently. We then propose a light-weight black-box tuning method (NMTune) to affine the feature space to mitigate the malignant effect of noise and improve generalization on both ID and OOD tasks, considering one may not be able to fully fine-tune or even access the pre-trained models. We conduct practical experiments on popular vision and language models that are pre-trained on noisy data for evaluation of our approach. Our analysis and results show the importance of this interesting and novel research direction, which we term Noisy Model Learning.

연구 동기 및 목표

  • 사전 훈련 데이터셋의 레이블 노이즈가 도메인 내 및 도메인 외 작업에서 다운스트림 모델의 일반화에 미치는 영향를 이해하는 것.
  • 레이블 노이즈가 도메인 내 이점이 있을 수 있음에도 불구하고 도메인 외 성능을 떨어뜨리는 이유를 조사하는 것.
  • 사전 훈련 노이즈로 인한 특성 공간 왜곡을 수정하는 경량 블랙박스 튜닝 방법을 개발하는 것.
  • 사전 훈련 모델에 대한 액세스나 전체 미세조정 없이도 도메인 내 및 도메인 외 작업에서의 일반화 성능을 향상시키는 것.
  • 강건한 사전 훈련 및 전이 학습을 위한 새로운 연구 방향, 즉 노이즈 모델 학습(Noisy Model Learning)을 설정하는 것.

제안 방법

  • 저자는 이미지넷-1K 및 YFCC15M의 합성 노이즈 버전을 대상으로 사전 훈련에 영향을 미치는 레이블 노이즈의 영향을 분석하기 위해 광범위한 실험을 수행한다.
  • 저자는 ReLU 활성화 함수를 사용하는 2층 MLP를 통해 특성 공간에 애핀 변환을 적용하는 경량 튜닝 방법인 NMTune을 제안한다.
  • NMTune은 세 가지 정규화 항을 포함한다: 평균 제곱 오차(MSE) 손실, 공분산 정규화(L_COV), 주요 특이값 정규화(L_SVD).
  • 이 방법은 특성 공간을 더 깔끔하고 일반화 가능한 분포로 정렬함으로써 노이즈의 영향을 줄이기 위해 최적화된다.
  • 이 방법은 블랙박스 설계로, 사전 훈련 모델에 추론 시간 액세스만 필요하며 전체 미세조정이 필요하지 않다.
  • 이 방법은 레이블 노이즈가 포함된 데이터로 사전 훈련된 시각 및 언어 모델에 대해 평가되었으며, 이는 ResNet-50 및 ViT를 포함한다.
(a) ID
(a) ID

실험 결과

연구 질문

  • RQ1사전 훈련 데이터의 레이블 노이즈가 도메인 내 및 도메인 외 다운스트림 성능에 어떤 영향을 미치는가?
  • RQ2레이블 노이즈가 도메인 내 성능 향상에 기여할 수 있음에도 불구하고 도메인 외 일반화 성능을 떨어뜨리는 이유는 무엇인가?
  • RQ3경량 블랙박스 튜닝 방법이 사전 훈련 노이즈로 인한 특성 공간 왜곡을 효과적으로 교정할 수 있는가?
  • RQ4제안된 방법이 전체 미세조정 없이 도메인 내 및 도메인 외 작업에서 일반화 성능을 향상시키는가?
  • RQ5다운스트림 데이터 자체에 노이즈가 포함되어 있을 경우에도 이 방법이 효과를 발휘할 수 있는가?

주요 결과

  • 사전 훈련 중 약간의 레이블 노이즈는 도메인 내 전이 성능을 향상시키지만, 특성 공간 왜곡으로 인해 항상 도메인 외 성능을 떨어뜨린다.
  • 노이즈가 있는 사전 훈련 하에서는 특성 공간이 정렬되지 않아 분포 이탈 상황에서 일반화 성능이 저하된다.
  • NMTune은 도메인 내 및 도메인 외 작업 모두에서 일반화 성능을 향상시키며, 일부 경우에서 표준 미세조정(LP)보다 뛰어나다. 특히 깨끗한 사전 훈련 모델에서 두드러진다.
  • 5% 및 10%의 레이블 노이즈가 포함된 CIFAR-10 및 CIFAR-100에서, NMTune은 이미지넷-1K 사전 훈련 ResNet-50에서 각각 75.06% 및 67.34%의 정확도를 기록했으며, 일부 설정에서 LP를 초월한다.
  • 절단 분석 결과, ReLU 비선형성과 2층 MLP 아키텍처가 최적임을 확인하였으며, 정규화 항을 제거할 경우 성능 저하가 발생한다.
  • 실행 시간 분석 결과, NMTune은 추가 계산 비용이 극히 적으며, 언어 모델의 도메인 외 작업 평균 1.45 GPU 시간을 소비하며, MLP 튜닝 대비 1.34에 가까운 수준을 유지한다.
(b) OOD
(b) OOD

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.