Skip to main content
QUICK REVIEW

[논문 리뷰] Heavy-Tailed Universality Predicts Trends in Test Accuracies for Very Large Pre-Trained Deep Neural Networks

Charles H. Martin, Michael W. Mahoney|arXiv (Cornell University)|2019. 01. 24.
Machine Learning in Materials Science인용 수 9
한 줄 요약

이 논문은 사전 훈련된 딥 네ural 네트워크에서 중량 행렬 상관관계의 비율 법 수치를 사용하여 테스트 데이터에 접근하지 않고도 테스트 정확도 추세를 예측할 수 있는 허브-테일드 메커니즘 유니버설리티(HT-MU) 기반의 통합 용량 제어 지표를 소개한다. 이 지표는 중량 행렬 상관관계의 비율 법 지수를 기반으로 하며, 허브-테일드 랜덤 매트릭스 이론에서 유도된 것으로, 26개의 다양한 아키텍처에서 보고된 ImageNet top-1 정확도와 강한 상관관계를 보이며, 전통적인 노름 기반 측정법보다 예측 능력에서 뛰어나다.

ABSTRACT

Given two or more Deep Neural Networks (DNNs) with the same or similar architectures, and trained on the same dataset, but trained with different solvers, parameters, hyper-parameters, regularization, etc., can we predict which DNN will have the best test accuracy, and can we do so without peeking at the test data? In this paper, we show how to use a new Theory of Heavy-Tailed Self-Regularization (HT-SR) to answer this. HT-SR suggests, among other things, that modern DNNs exhibit what we call Heavy-Tailed Mechanistic Universality (HT-MU), meaning that the correlations in the layer weight matrices can be fit to a power law (PL) with exponents that lie in common Universality classes from Heavy-Tailed Random Matrix Theory (HT-RMT). From this, we develop a Universal capacity control metric that is a weighted average of PL exponents. Rather than considering small toy NNs, we examine over 50 different, large-scale pre-trained DNNs, ranging over 15 different architectures, trained on ImagetNet, each of which has been reported to have different test accuracies. We show that this new capacity metric correlates very well with the reported test accuracies of these DNNs, looking across each architecture (VGG16/.../VGG19, ResNet10/.../ResNet152, etc.). We also show how to approximate the metric by the more familiar Product Norm capacity measure, as the average of the log Frobenius norm of the layer weight matrices. Our approach requires no changes to the underlying DNN or its loss function, it does not require us to train a model (although it could be used to monitor training), and it does not even require access to the ImageNet data.

연구 동기 및 목표

  • 테스트 데이터나 레이블에 접근하지 않고 대규모 사전 훈련된 DNN의 테스트 정확도 추세를 예측하기 위해.
  • 다양한 DNN 아키텍처에 적용 가능한 통합형, 비지도 용량 제어 지표를 개발하기 위해.
  • 중량 행렬의 허브-테일드 통계적 성질이 일반화 성능과 상관이 있음을 검증하기 위해.
  • DNN 설계 및 파인튜닝을 안내하기 위한 확장 가능하고 아키텍처에 관계없는 지표를 제공하기 위해.
  • 비의미 있는 VC 기반 경계와 데이터 의존적 노름 측정법에 대한 이론 기반 대안을 제공하기 위해.

제안 방법

  • 이 방법은 중량 행렬의 상관관계 스펙트럼에 대한 비율 법 피팅을 통해 DNN 중량 행렬에서 허브-테일드 메커니즘 유니버설리티(HT-MU)를 식별한다.
  • 모든 레이어의 비율 법 지수에 대한 가중 평균을 계산하여 통합 용량 제어 지표 $\hat{\alpha}$를 산출한다.
  • 이 지표는 레이어 중량의 로그 프로베니우스 노름의 평균으로 근사 가능하며, 이는 HT-RMT와 기존의 노름 기반 용량 측정법을 연결한다.
  • 모델 재훈련, 테스트 데이터, 손실 함수 수정이 필요하지 않다.
  • OSMR 샌드박스에서 제공하는 기존 사전 훈련된 모델을 활용하여 파이토치 구현에서 중량 행렬을 분석한다.
  • 통계적 검증은 $\hat{\alpha}$와 보고된 ImageNet top-1 정확도 간의 상관계수 분석을 통해 수행된다.

실험 결과

연구 질문

  • RQ1테스트 데이터를 사용하지 않고도 사전 훈련된 DNN의 테스트 정확도 추세를 예측할 수 있는 통합형, 비지도 지표가 존재하는가?
  • RQ2DNN 중량 행렬의 허브-테일드 상관관계가 일반화 능력의 통합 서명으로서 작용하는가?
  • RQ3제안된 $\hat{\alpha}$ 지표는 기존의 노름 기반 용량 측정법보다 예측 능력에서 어떻게 비교되는가?
  • RQ4지표가 테스트 정확도와 상관관계를 가지지 못하는 아키텍처적 예외가 존재하는가?
  • RQ5데이터 泄露 없이 아키텍처 탐색 또는 파인튜닝을 안내하는 데 이 지표를 사용할 수 있는가?

주요 결과

  • $\hat{\alpha}$ 지표는 15개 아키텍처에서 온 26개의 사전 훈련된 DNN에서 보고된 ImageNet top-1 테스트 정확도와 강하게 상관관계를 보인다.
  • VGG 및 ResNet 시리즈에서는 $\hat{\alpha}$가 평균 로그 프로베니우스 노름 지표와 동일하거나 더 잘 예측한다.
  • 11개의 추가 아키텍처 시리즈 중 8개에서는 더 작은 $\hat{\alpha}$ 값이 더 높은 테스트 정확도를 의미하며, 26개 모델 중 유일한 이상치 하나만 존재한다.
  • 반례도 존재한다—ResNeXt, MeNet, FDMobileNet에서는 지표가 정확도 추세를 예측하지 못하며, 이는 아키텍처적 제약을 시사한다.
  • 지표는 다양한 아키텍처에 걸쳐 강건하며, 훈련 데이터, 테스트 데이터, 모델 재훈련에 접근할 필요가 없다.
  • $\hat{\alpha}$ 지표는 평균 로그 프로베니우스 노름으로 근사 가능하며, 이는 HT-RMT와 표준 노름 기반 용량 제어를 연결한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.