Skip to main content
QUICK REVIEW

[논문 리뷰] GradMax: Growing Neural Networks using Gradient Information

Utku Evci, Bart van Merriënboer|arXiv (Cornell University)|2022. 01. 13.
Neural Networks and Applications인용 수 9
한 줄 요약

GradMax는 신경망에 새로운 뉴런을 추가함으로써 네트워크를 성장시키는 방법을 제안한다. 이 방법은 특이값 분해(SVD)를 사용해 최적의 초기화를 통해 기울기 노름을 최대화한다. 이 접근법은 재학습 없이도 학습 동역학을 향상시켜 시각 작업 전반에서 더 빠른 수렴을 이룬다. 학습된 표현을 유지한다.

ABSTRACT

The architecture and the parameters of neural networks are often optimized independently, which requires costly retraining of the parameters whenever the architecture is modified. In this work we instead focus on growing the architecture without requiring costly retraining. We present a method that adds new neurons during training without impacting what is already learned, while improving the training dynamics. We achieve the latter by maximizing the gradients of the new weights and find the optimal initialization efficiently by means of the singular value decomposition (SVD). We call this technique Gradient Maximizing Growth (GradMax) and demonstrate its effectiveness in variety of vision tasks and architectures.

연구 동기 및 목표

  • 신경망 아키텍처를 수정할 때 재학습의 비효율성을 해결하기 위해.
  • 학습 증가 과정에서 손실 감소가 아닌 기울기 크기를 중심으로 학습 동역학을 향상시키기 위해.
  • 기울기 기여도를 최대화하는 뉴런의 닫힌 형태 초기화 방법을 개발하기 위해.
  • 성능 저하 없이 또는 대규모 초기 모델이 필요 없이 아키텍처 성장을 가능하게 하기 위해.
  • 기존의 신경망 아키텍처 탐색 또는 프루닝 방법에 대한 확장 가능하고 효율적인 대안을 제공하기 위해.

제안 방법

  • GradMax는 전체 배치 기울기 행렬의 상위-k 왼쪽 특이벡터를 사용해 새로운 뉴런을 초기화한다.
  • 이 방법은 성장 전후에 네트워크 출력이 그대로 유지되도록 하며, 새로운 뉴런의 가중치를 기울기 노름을 최대화하도록 설정한다.
  • 초기화 문제를 새로운 가중치에 대한 기울기 노름을 최대화하는 것으로 공식화하며, 이는 SVD를 통해 닫힌 형태의 해를 얻을 수 있다.
  • 이 방법은 학습 중에 적용되며, 고정 간격 또는 사전 정의된 스케줄에 따라 새로운 뉴런을 추가한다.
  • 초기화 시점에 네트워크 출력에 변화가 없도록 하여 기존 표현을 유지한다.
  • 완전 연결층과 컨볼루션층 모두와 호환되며, 넓이 또는 새로운 레이어 추가를 지원한다.

실험 결과

연구 질문

  • RQ1재학습 없이도 신경망을 성장시킬 수 있으며, 학습 동역학을 향상시킬 수 있는가?
  • RQ2초기화 시 기울기 노름을 최대화하면 수렴 속도가 빨라지는가?
  • RQ3SVD를 사용해 닫힌 형태로 새로운 뉴런의 최적 초기화를 찾을 수 있는가?
  • RQ4GradMax는 무작위 또는 손실 감소 기반 초기화 전략에 비해 학습 속도와 일반화 성능에서 뛰어나게 되는가?
  • RQ5제안된 방법은 다양한 아키텍처와 시각 작업에 적용 가능한가?

주요 결과

  • GradMax는 ImageNet 및 CIFAR-10을 포함한 여러 시각 작업에서 성장 후 재학습 없이도 더 빠른 학습 수렴을 달성한다.
  • 이 방법은 성장 전후에 네트워크 출력 분포를 유지하여 학습된 표현을 그대로 보존한다.
  • SVD 기반 초기화가 효과적으로 새로운 뉴런의 기울기 노름을 최대화하며, 이는 학습 전반에 걸쳐 유지된다.
  • 학습 초반에 전체 배치와 미니배치 SVD 간의 일치도가 높아, 미니배치 근사치 사용의 타당성을 뒷받침한다.
  • 특히 초기 학습 단계에서 무작위 또는 손실 감소 기반 초기화 방법보다 GradMax가 뛰어난 성능을 보인다.
  • 이 방법은 넓이 성장과 깊이 성장 모두에 효과적이며, 보다 광범위한 신경망 아키텍처 탐색 파이프라인에 통합될 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.