Skip to main content
QUICK REVIEW

[논문 리뷰] A Decade's Battle on Dataset Bias: Are We There Yet?

Zhuang Liu, Kaiming He|arXiv (Cornell University)|2024. 03. 13.
Artificial Intelligence in Healthcare인용 수 8
한 줄 요약

이 논문은 현대 신경망이 어떤 큰 다양성 데이터셋 중에서 이미지가 어느 데이터셋에서 왔는지 정확히 분류할 수 있음을 보여주며, 대규모의 덜 큐레이션된 데이터에서도 지속적인 데이터셋 바이어스가 있음을 시사한다.

ABSTRACT

We revisit the "dataset classification" experiment suggested by Torralba & Efros (2011) a decade ago, in the new era with large-scale, diverse, and hopefully less biased datasets as well as more capable neural network architectures. Surprisingly, we observe that modern neural networks can achieve excellent accuracy in classifying which dataset an image is from: e.g., we report 84.7% accuracy on held-out validation data for the three-way classification problem consisting of the YFCC, CC, and DataComp datasets. Our further experiments show that such a dataset classifier could learn semantic features that are generalizable and transferable, which cannot be explained by memorization. We hope our discovery will inspire the community to rethink issues involving dataset bias.

연구 동기 및 목표

  • 현대 아키텍처에서 데이터셋 바이어스와 모델 능력 간의 재고를 자극한다.
  • 현 시점의 데이터셋이 모델이 활용할 수 있는 구분 가능한 출처 시그니처를 여전히 보유하는지 경험적으로 평가한다.
  • 학습된 데이터셋-구분 특징이 하류의 의미론적 작업으로 전이되는지 조사한다.
  • 데이터 크기, 증강, 모델 아키텍처, 자기지도 사전학습이 데이터셋 분류 성능에 어떤 영향을 미치는지 검토한다.

제안 방법

  • 각 데이터셋을 N-way 이미지 분류 문제의 한 클래스로 다루어 데이터셋 분류 작업을 정의하고 이를 운영화한다.
  • 다양하고 대규모의 데이터셋(YFCC, CC, DataComp, WIT, LAION, ImageNet)을 모아 각 데이터셋당 1M으로 ConvNeXt 및 다른 아키텍처를 훈련한다.
  • 데이터셋 조합 간의 보류된 검증 이미지에서 데이터셋 분류 정확도를 평가한다.
  • 색상 변동, 잡음, 흐림, 저해상도 등의 손상 실험을 통해 저수준 아티팩트에 대한 견고성을 테스트한다.
  • 완전한 지도학습 훈련과 의사 데이터셋 설정을 대조하여 암기와 일반화의 구분을 시도한다.
  • 자기지도 사전학습(MAE)을 탐색하고 선형 프로빙을 따라가며 데이터셋-구분 특징의 전이를 평가한다.

실험 결과

연구 질문

  • RQ1현대의 신경망이 대규모의 다양한 데이터셋에서 이미지의 출처 데이터셋을 신뢰성 있게 식별할 수 있는가?
  • RQ2학습된 데이터셋-구분 특징이 의미론적 이미지 분류 작업으로 전이되는가?
  • RQ3높은 데이터셋 분류 정확도가 암기 때문인가 아니면 일반화 가능한 패턴 때문인가?
  • RQ4데이터 증강, 모델 크기, 자기지도 사전학습이 데이터셋 분류 성능에 어떤 영향을 미치는가?

주요 결과

  • 신경망은 데이터셋 조합 전반에서 높은 데이터셋 분류 정확도를 달성하며, 예를 들어 YFCC+CC+DataComp 보류된 검증에서 84.7%.
  • 더 많은 훈련 데이터와 강력한 증강은 일반적으로 정확도를 높이며 암 memorization 보다는 일반화 가능한 패턴을 시사한다.
  • 심지어 작은 모델도 강한 데이터셋 분류 성능을 달성할 수 있다(예: ConvNeXt Tiny 27M 파라미터가 84.7%에 도달).
  • 의사 데이터셋 실험은 암기가 실제 데이터셋 분류 작업의 주된 원동력일 가능성이 낮음을 시사하며, 의사 설정에서 모델은 일반화에 실패한다.
  • 선형 프로빙이 수반된 자기지도 사전학습은 데이터셋-구분 특징의 전이를 크게 만들며(최대 78.4%), 데이터셋-구분 특징은 선형 프로빙을 통해 ImageNet에서 현저한 개선을 제공한다.
  • 데이터셋 분류에서 학습된 특징은 의미론적 작업에 대해 특화된 자기지도 방법에 비해 실질적이면서도 열등한 이점을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.