Skip to main content
QUICK REVIEW

[논문 리뷰] Penalizing Gradient Norm for Efficiently Improving Generalization in Deep Learning

Yang Zhao, Hao Zhang|arXiv (Cornell University)|2022. 02. 08.
Advanced Neural Network Applications인용 수 16
한 줄 요약

이 논문은 손실 함수의 기울기 노름을 페널티로 삼아 딥 러닝의 일반화 성능을 향상시키는 새로운 최적화 방법을 제안한다. 이는 헤시안 행렬 계산을 피하기 위해 일阶 근사를 사용함으로써 비용이 많이 드는 계산을 피한다. 제안된 방법은 표준 SGD와 Sharpness-Aware Minimization(SAM)을 모두 능가하며, CIFAR 및 ImageNet 벤치마크에서 최신 기준 성능을 달성하여 최대 70% 향상된 성능을 기록한다.

ABSTRACT

How to train deep neural networks (DNNs) to generalize well is a central concern in deep learning, especially for severely overparameterized networks nowadays. In this paper, we propose an effective method to improve the model generalization by additionally penalizing the gradient norm of loss function during optimization. We demonstrate that confining the gradient norm of loss function could help lead the optimizers towards finding flat minima. We leverage the first-order approximation to efficiently implement the corresponding gradient to fit well in the gradient descent framework. In our experiments, we confirm that when using our methods, generalization performance of various models could be improved on different datasets. Also, we show that the recent sharpness-aware minimization method (Foret et al., 2021) is a special, but not the best, case of our method, where the best case of our method could give new state-of-art performance on these tasks. Code is available at {https://github.com/zhaoyang-0204/gnp}.

연구 동기 및 목표

  • 과다 매개변수화된 딥 뉴럴 네트워크에서의 열악한 일반화 문제를 해결하기 위해 최적화 과정을 더 평탄한 최소값으로 유도함으로써 명시적으로 지도하는 것.
  • 헤시안 행렬 계산을 통한 기울기 노름을 직접 최소화하는 것은 계산적으로 비현실적이므로, 효율적인 일계 근사를 도입하여 이를 해결하는 것.
  • 기울기 노름을 페널티로 삼는 것이 더 평탄한 최소값을 이끌어내며, 이는 날카로운 최소값보다 일반화 성능이 뛰어나다는 점을 입증하는 것.
  • 최근에 제안된 SAM 방법이 제안된 프레임워크의 특수한 경우임을 보이고, 최적의 하이퍼파rameter 조정을 통해 제안된 방법이 더 높은 성능을 달성할 수 있음을 보여주는 것.
  • 실제 학습 환경에서 일반화 성능 향상을 극대화하기 위한 하이퍼파rameter 선택에 실용적인 가이드라인을 제공하는 것.

제안 방법

  • 네트워크 매개변수에 대한 손실 함수의 기울기의 L2 노름에 페널티 항을 추가하는 새로운 학습 목표를 제안한다.
  • 이차 도함수를 피하기 위해 기울기 노름의 기울기를 일계 근사를 통해 계산함으로써, 표준 SGD 프레임워크에서 효율적으로 구현할 수 있도록 한다.
  • SAM과 유사한 미니맥스 문제로 최적화를 공식화하지만, 더 일반적이고 융통성 있는 페널티 구조를 갖춘다.
  • 두 개의 하이퍼파rameter를 도입한다: α(페널티의 크기를 제어)와 r(미니맥스 공식화에서의 변동 반경을 제어).
  • 표준 딥 러닝 프레임워크를 사용하여, 일계 근사를 통한 역전파를 통해 기울기 노름 페널티를 계산함으로써 구현한다.
  • 기울기 노름이 너무 이르게 0이 되는 것을 방지하기 위해 하이퍼파rameter를 신중히 선택함으로써 안정적인 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1손실 함수의 기울기 노름을 페널티로 삼는 것은 딥 뉴럴 네트워크에서 더 평탄한 최소값을 이끌어내고 일반화 성능을 향상시킬 수 있는가?
  • RQ2헤시안 행렬을 계산하지 않고도 기울기 노름 페널티를 어떻게 효율적으로 구현할 수 있는가?
  • RQ3Sharpness-Aware Minimization(SAM) 방법은 제안된 일반 프레임워크의 특수한 경우인가?
  • RQ4다양한 아키텍처와 데이터셋에서 최적의 일반화 성능를 얻기 위해 어떤 하이퍼파arameter 설정(α 및 r)이 필요한가?
  • RQ5제안된 방법은 CIFAR-10, CIFAR-100, ImageNet과 같은 다양한 벤치마크에서 표준 SGD와 SAM을 일관되게 능가하는가?

주요 결과

  • 제안된 방법은 CIFAR-10 및 CIFAR-100에서 최신 기준 성능을 달성하며, SAM보다 최대 70% 높은 향상을 기록한다.
  • ImageNet에서는 표준 학습 대비 VGG16-BN에서 상위-1 오차율을 0.37% 감소시키고, ResNet50에서는 0.29%, ResNet101에서는 0.45% 감소시키며, SAM을 초월하는 성능을 기록한다.
  • CIFAR-10에서 WideResNet-28-10을 사용할 경우 최적의 하이퍼파aram터(α=0.8, r∈{0.05,0.1})가 가장 높은 성능을 낸 반면, 더 큰 α 값(예: α=2.0)은 기울기 노름의 조기 붕괴를 유도하고 테스트 정확도를 떨어뜨린다.
  • 특히 하이퍼파aram터를 정교하게 조정한 경우, 일부 설정에서 SAM보다 학습 안정성이 향상된다.
  • 기울기 노름 페널티는 최적화기가 더 평탄한 최소값으로 수렴하도록 효과적으로 유도하며, 이는 더 나은 일반화와 관련이 있다.
  • 이 방법은 컨볼루션 네트워크와 비전 트랜스포머를 포함한 다양한 아키텍처에 널리 적용 가능하며, 소규모(CIFAR) 및 대규모(ImageNet) 데이터셋 모두에서 효과적으로 작동한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.