Skip to main content
QUICK REVIEW

[논문 리뷰] Exploring the Limits of Large Scale Pre-training

Samira Abnar, Mostafa Dehghani|arXiv (Cornell University)|2021. 10. 05.
Multimodal Machine Learning Applications참고 문헌 52인용 수 35
한 줄 요약

요약: 이 논문은 업스트림 정확도가 증가함에 따라 다운스트림 이미지 인식 성능이 포화되며, Vision Transformers, MLP-Mixers, ResNets을 통한 대규모 프리-트레이닝에도 불구하고 다운스트림 성능을 예측하는 파워-로(power-law) 모델을 제공한다.

ABSTRACT

Recent developments in large-scale machine learning suggest that by scaling up data, model size and training time properly, one might observe that improvements in pre-training would transfer favorably to most downstream tasks. In this work, we systematically study this phenomena and establish that, as we increase the upstream accuracy, the performance of downstream tasks saturates. In particular, we investigate more than 4800 experiments on Vision Transformers, MLP-Mixers and ResNets with number of parameters ranging from ten million to ten billion, trained on the largest scale of available image data (JFT, ImageNet21K) and evaluated on more than 20 downstream image recognition tasks. We propose a model for downstream performance that reflects the saturation phenomena and captures the nonlinear relationship in performance of upstream and downstream tasks. Delving deeper to understand the reasons that give rise to these phenomena, we show that the saturation behavior we observe is closely related to the way that representations evolve through the layers of the models. We showcase an even more extreme scenario where performance on upstream and downstream are at odds with each other. That is, to have a better downstream performance, we need to hurt upstream accuracy.

연구 동기 및 목표

  • 다양한 아키텍처와 데이터셋에 걸쳐 업스트림 프리-트레이닝 정확도 향상이 다운스트림 이미지 인식 태스크로 어떻게 전달되는지 조사한다.
  • 업스트림 정확도가 증가함에 따른 다운스트림 성능의 포화 현상을 정량화한다.
  • 비선형성과 데이터/샘플 편향을 설명하는 강건한 예측 모델(파워-로)을 개발한다.
  • 헤드 하이퍼파라미터 설정이 정보가 헤드에서 하층으로 전달되는 경우를 포함해 다운스트림 전이에 영향을 주는 아키텍처 및 하이퍼파라미터 요인을 식별한다.

제안 방법

  • Vision Transformers, MLP-Mixers, ResNets를 대상으로 JFT 또는 ImageNet21K에서 프리트레이닝하고 20개가 넘는 다운스트림 태스크에서 평가한 4800건이 넘는 실험을 수집하고 분석한다.
  • 불가역 오차항이 있는 파워-로 형태로 업스트림 정확도와 다운스트림 성능을 함수로 모델링한다.
  • 샘플링 편향을 완화하고 주어진 US 정확도에 대해 최대 DS 성능을 포착하기 위해 볼록 껍질(best-case) 적합을 사용한다.
  • 모델 크기, 데이터 규모, 계산량을 달리하는 통제된 스케일링 실험을 수행하여 US 정확도가 DS 성능에 미치는 영향을 평가한다.
  • 관계가 보이는 층 간 표현 진화를 조사하여 관찰된 포화 현상을 설명한다.
  • 헤드의 하이파라미터 설정이 정보가 헤드에서 하위 층으로 이동하게 만들어 업스트림과 다운스트림 성능이 발산하는 사례를 탐구한다.

실험 결과

연구 질문

  • RQ1업스트림 정확도를 확장 또는 하이퍼파라미터 변경을 통해 향상시키는 것이 태스크 전반에서 다운스트림 정확도에 비례하는 이득으로 이어지는가?
  • RQ2다운스트림 성능은 업스트림 이득으로 보편적으로 증가하는가, 아니면 포화가 발생하는가?
  • RQ3다양한 아키텍처와 태스크에 대해 간단한 모델로 업스트림 정확도에서 다운스트림 성능을 신뢰성 있게 예측할 수 있는가?
  • RQ4DS-US 관계 및 포화 수준을 조절하는 요인(아키텍처, 데이터, 컴퓨트, 하이퍼파라미터)은 무엇인가?
  • RQ5특정 하이퍼파라미터 구성에서 업스트림과 다운스트림 성능이 발산하는 이유는 무엇인가?

주요 결과

  • 다운스트림 정확도는 업스트림 정확도가 증가함에 따라 포화되며, DS가 높은 US 정확도에서도 100%에 거의 도달하지 않는다.
  • 무가역 오차항이 있는 파워-로 관계가 다양한 작업들에서 DS 대 US 성능을 효과적으로 모델링한다.
  • 다운스트림 태스크에 대해 가장 좋은 모델은 유사한 업스트림 정확도에서도 태스크마다 다를 수 있으며, 만능 모델은 없다.
  • 결과의 볼록 껍질에 파워-로를 적합시키면 견고한 DS 예측이 가능하고, 샘플 밀도에 덜 민감하다.
  • US 정확도는 DS 정확도에 강한 예측력을 제공하며, US 정확도에 조건을 두면 DS 성능에 대한 모델 크기, 데이터 크기, 계산량의 변화가 추가적인 효과를 줄인다.
  • 헤드 가중치 감소, 학습률 등 하이퍼파라미터 선택이 DS와 US 성능의 발산을 초래할 수 있으며, 이는 헤드에서 하위 층으로 정보가 이동하기 때문으로 설명된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.