Skip to main content
QUICK REVIEW

[논문 리뷰] On The State of Data In Computer Vision: Human Annotations Remain Indispensable for Developing Deep Learning Models

Zeyad Emam, Andrew Kondrich|arXiv (Cornell University)|2021. 07. 31.
Advanced Neural Network Applications참고 문헌 72인용 수 7
한 줄 요약

이 논문은 컴퓨터 비전 분야에서 딥러닝 모델을 훈련시키는 데 있어 인간이 레이블링한 데이터의 역할을 조사하며, 자기지도 학습 및 합성 데이터 기법의 발전에도 불구하고 최첨단 성능을 달성하기 위해서는 고품질의 인간 레이블링 데이터셋이 여전히 필수적이라고 결론을 내린다. JFT-300M 및 Instagram-1B와 같은 대규모 데이터셋을 분석하여, 심지어 레이블 노이즈가 상당히 많더라도 인간 레이블링 데이터가 합성 대안 대비 모델의 일반화 능력과 공정성 측면에서 뛰어나다는 것을 입증한다.

ABSTRACT

High-quality labeled datasets play a crucial role in fueling the development of machine learning (ML), and in particular the development of deep learning (DL). However, since the emergence of the ImageNet dataset and the AlexNet model in 2012, the size of new open-source labeled vision datasets has remained roughly constant. Consequently, only a minority of publications in the computer vision community tackle supervised learning on datasets that are orders of magnitude larger than Imagenet. In this paper, we survey computer vision research domains that study the effects of such large datasets on model performance across different vision tasks. We summarize the community's current understanding of those effects, and highlight some open questions related to training with massive datasets. In particular, we tackle: (a) The largest datasets currently used in computer vision research and the interesting takeaways from training on such datasets; (b) The effectiveness of pre-training on large datasets; (c) Recent advancements and hurdles facing synthetic datasets; (d) An overview of double descent and sample non-monotonicity phenomena; and finally, (e) A brief discussion of lifelong/continual learning and how it fares compared to learning from huge labeled datasets in an offline setting. Overall, our findings are that research on optimization for deep learning focuses on perfecting the training routine and thus making DL models less data hungry, while research on synthetic datasets aims to offset the cost of data labeling. However, for the time being, acquiring non-synthetic labeled data remains indispensable to boost performance.

연구 동기 및 목표

  • 컴퓨터 비전 분야에서 현재 데이터의 상태를 평가하고, 특히 딥러닝 모델 훈련에 있어 인간 레이블링 데이터셋의 역할을 분석하는 것.
  • JFT-300M 및 Instagram-1B와 같은 대규모 레이블링 데이터셋에서의 사전 훈련이 최종 작업 성능 향상에 어떻게 기여하는지 평가하는 것.
  • 대규모 데이터셋에서의 레이블 노이즈가 모델의 일반화 능력에 미치는 영향을 조사하고, 이로 인해 성능 저하가 발생하는지 여부를 분석하는 것.
  • 합성 데이터 및 자기지도 학습 기법이 인간 레이블링 데이터의 대안으로서의 잠재력을 탐색하는 것.
  • 대규모, 긴 꼬리형, 편향된 데이터셋에서 훈련함으로써 발생하는 공정성 문제를 검토하고, 합성 데이터가 이러한 문제를 완화시킬 수 있는지 여부를 분석하는 것.

제안 방법

  • JFT-300M(3억 장의 이미지, 3억 7,500만 개의 노이즈 있는 레이블), Instagram-1B(35억 장의 이미지), YFCC-100M을 포함한 주요 공개 및 비공개 컴퓨터 비전 데이터셋을 조사하여 규모와 레이블 품질을 분석하는 것.
  • JFT-300M에서 사전 훈련한 모델의 성능을 ImageNet과 같은 최종 작업에 대해 미세조정하여 정확도 향상과 일반화 행동을 측정하는 것.
  • 레이블 노이즈의 영향을 평가하기 위해 데이터셋에 무작위 레이블을 삽입(예: Instagram-1B에서 50% 해시태그 교체)하고 정확도 저하 정도를 측정하는 것.
  • Patrini 등(2017)의 손실 보정 기법과 레이블 스무딩을 포함한 레이블 노이즈 대응 기법을 Clothing1M과 같은 데이터셋에 적용하여 분석하는 것.
  • 생성 모델(예: GANs)을 활용한 합성 데이터 생성 기법을 통해 공정성 향상을 탐색하고, UCI Adult 인구 조사 데이터셋을 실험 기반으로 활용하는 것.
  • 데이터셋 크기가 증가함에 따라 모델 성능에서 이중 내림막 현상(double descent)과 표본의 비단조화성(non-monotonicity)이 나타나는 현상을 분석하는 것.

실험 결과

연구 질문

  • RQ1JFT-300M 및 Instagram-1B와 같은 대규모 인간 레이블링 데이터셋에서 훈련된 모델이 더 작은 데이터셋 또는 합성 데이터셋에서 훈련된 모델보다 얼마나 뛰어난 성능을 보이는가?
  • RQ2대규모 데이터셋에서의 레이블 노이즈가 모델의 일반화 능력에 미치는 영향은 무엇이며, 기존의 보정 기법이 이 영향을 완화시킬 수 있는가?
  • RQ3합성 데이터가 복잡한 비전 작업에서 모델의 공정성과 성능 향상에 효과적으로 대체될 수 있는가?
  • RQ4정확도와 효율성 측면에서 대규모 데이터셋에서의 사전 훈련과 고품질의 작은 데이터셋에서의 미세조정 간의 상충 관계는 무엇인가?
  • RQ5데이터셋 크기와 클래스 불균형이 딥러닝 모델의 알고리즘적 공정성에 어떤 영향을 미치는가?

주요 결과

  • JFT-300M에서의 사전 훈련은 ImageNet과 같은 최종 작업에서 뚜렷한 성능 향상을 이끌어내어 대규모 인간 레이블링 데이터의 가치를 입증한다.
  • Instagram-1B에서 50%의 해시태그를 무작위로 교체한 경우, 모델 정확도가 7.31%에서 14.29%까지 감소하여 노이즈가 명백한 부정적 영향을 미친다는 것을 확인한다.
  • JFT-300M에서 20%의 오류율이 존재하는 고도의 레이블 노이즈가 있음에도 불구하고 모델은 강력한 일반화 능력을 유지함으로써, 완벽한 레이블이 아니더라도 고품질의 성능을 달성할 수 있음을 시사한다.
  • 손실 보정 기법을 적용한 Clothing1M 데이터셋에서 정확도가 16.59% 향상되어, 레이블 노이즈는 적절한 기법을 통해 완화될 수 있음을 보여준다.
  • 합성 데이터 생성 기법은 표본 데이터(예: UCI Adult)에서 공정성 향상에 유망한 결과를 보였지만, 복잡하고 비정형적인 이미지 데이터에 대한 효과성은 아직 입증되지 않았고 미해결 과제로 남아 있다.
  • 논문은 인간 레이블링 데이터가 자율 주행 차량과 같은 실제 응용 분야에서 임무 중심의 고성능 딥러닝 모델을 훈련시키는 데 있어 여전히 불가결하다고 결론을 내린다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.