Skip to main content
QUICK REVIEW

[논문 리뷰] Model Zoos: A Dataset of Diverse Populations of Neural Network Models

Konstantin Schürholt, Diyar Taskiran|arXiv (Cornell University)|2022. 09. 29.
Neural Networks and Applications인용 수 5
한 줄 요약

이 논문은 8개의 이미지 데이터셋에서 훈련된 27개의 다양한 모델 조류에 걸쳐 50,360개의 신경망 모델로 구성된 대규모이고 체계적으로 캐릭터화된 데이터셋을 소개한다. 다양한 초모수 조합을 포함하며, 연구 분야인 모델 분석, 학습 역학, 표현 학습, 가중치의 생성 모델링을 가능하게 하며, 보다 높은 유용성과 재현 가능성을 확보하기 위해 벤치마크와 희소화된 모델 쌍을 포함하고 있다.

ABSTRACT

In the last years, neural networks (NN) have evolved from laboratory environments to the state-of-the-art for many real-world problems. It was shown that NN models (i.e., their weights and biases) evolve on unique trajectories in weight space during training. Following, a population of such neural network models (referred to as model zoo) would form structures in weight space. We think that the geometry, curvature and smoothness of these structures contain information about the state of training and can reveal latent properties of individual models. With such model zoos, one could investigate novel approaches for (i) model analysis, (ii) discover unknown learning dynamics, (iii) learn rich representations of such populations, or (iv) exploit the model zoos for generative modelling of NN weights and biases. Unfortunately, the lack of standardized model zoos and available benchmarks significantly increases the friction for further research about populations of NNs. With this work, we publish a novel dataset of model zoos containing systematically generated and diverse populations of NN models for further research. In total the proposed model zoo dataset is based on eight image datasets, consists of 27 model zoos trained with varying hyperparameter combinations and includes 50'360 unique NN models as well as their sparsified twins, resulting in over 3'844'360 collected model states. Additionally, to the model zoo data we provide an in-depth analysis of the zoos and provide benchmarks for multiple downstream tasks. The dataset can be found at www.modelzoos.cc.

연구 동기 및 목표

  • 모델 분석, 역학, 표현 학습, 가중치의 생성 모델링 분야에서의 재현 가능성을 저해하는 표준화되고 대규모의 신경망 모델 집합(모델 조류)에 대한 데이터셋 부족 문제를 해결한다.
  • 통합된, 체계적으로 생성된 데이터셋을 제공함으로써 초모수 변화를 통제하고 포괄적인 메타데이터를 제공함으로써 연구의 번거로움을 줄인다.
  • 모델 분석, 학습 역학 추론, 표현 학습, 신경망 가중치의 생성 모델링 분야에서 새로운 연구를 가능하게 한다.
  • 공동으로 사용 가능한, 공개된 데이터셋을 통해 여러 하류 작업에서의 방법 비교 및 벤치마킹을 지원한다.
  • 모델 집단 내에서의 구조적 성질, 예를 들어 곡률, 매끄러움, 일반화 패턴 등을 연구할 수 있도록 한다.

제안 방법

  • 두 가지 CNN 아키텍처를 사용하여 8개의 표준 이미지 분류 데이터셋에서 27개의 모델 조류를 체계적으로 훈련시키며, 다양한 초모수 조합을 적용한다.
  • 50,360개의 고유한 신경망 모델과 그들의 희소화된 동반 모델을 수집하고 저장하여 총 380만 개 이상의 모델 상태를 확보한다.
  • 모든 모델에 대해 훈련 초모수, 정확도, 일반화 갭, 기타 모델 성질을 포함한 포괄적인 메타데이터를 통합한다.
  • 학습 초모수(예: 학습률, 가중치 감소, 최적화기)와 같은 제어 가능한 생성 요인을 설계하여 모델 집단 행동의 체계적 분석을 가능하게 한다.
  • 모델 성질 예측, 학습 역학 추론, 표현 학습, 모델 생성의 네 가지 핵심 사용 사례를 위한 표준화된 벤치마크를 제공한다.
  • 이 데이터셋을 사용하여 모델 집단의 표현을 학습하고 평가함으로써, 전이 학습 및 모델 생성과 같은 하류 작업을 가능하게 한다.

실험 결과

연구 질문

  • RQ1제어된 초모수 변화에 따라 신경망 모델 집단이 가중치 공간에서 어떻게 체계적이고 매끄러운 궤적을 형성하는가?
  • RQ2모델 조류는 훈련 궤적을 따라 일반화 추세나 과적합 패턴과 같은 잠재적 학습 역학을 어느 정도 드러낼 수 있는가?
  • RQ3모델 집단의 학습된 표현은 원시 가중치나 통계 자료에 비해 정확도나 강건성과 같은 모델 성질 예측에 얼마나 효과적인가?
  • RQ4모델 조류는 제어 가능한 성질을 가진 새로운 고성능 신경망 가중치 생성에 얼마나 효과적인가?
  • RQ5집단 수준의 분석에서 희소화된 모델 쌍과 밀도 모델 간의 구조적 및 기능적 관계는 무엇인가?

주요 결과

  • 27개의 모델 조류에 걸쳐 50,360개의 고유한 신경망 모델을 포함하며, 희소화된 동반 모델까지 포함해 총 380만 개 이상의 모델 상태를 확보하였다.
  • 모델 조류는 초모수 변화에 따라 일관된 기하학적 패턴을 보이며, 가중치 공간에서 체계적이고 매끄러운 궤적을 형성한다.
  • 모델 집단에서 학습된 표현을 사용할 경우 원시 가중치나 통계 자료 기반 방법보다 모델 성질 예측 작업에서 성능 향상을 이룬다.
  • 희소화된 모델 쌍은 가중치 크기 분포와 성능 트레이드오프 패턴에서 일관된 패tern을 드러내며, 프루닝 효과의 집단 수준 분석을 지원한다.
  • 이 데이터셋은 인구 기반 접근법을 통한 조기 정지, 초모수 탐색, 전이 학습 등의 방법 개발 및 벤치마킹을 지원한다.
  • 표준화된 벤치마크의 가용성 덕분에, 모델 분석, 표현 학습, 생성 모델링 작업에서의 방법 비교 및 재현 가능성이 직접 가능해졌다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.