Skip to main content
QUICK REVIEW

[논문 리뷰] Low-Pass Filtering SGD for Recovering Flat Optima in the Deep Learning Optimization Landscape

Devansh Bisla, Jing Wang|arXiv (Cornell University)|2022. 01. 20.
Neural Networks and Applications인용 수 4
한 줄 요약

이 논문은 일반화 성능이 뛰어난 평탄한 최소값으로 향하도록 안내하기 위해 손실 경계면의 저역통과 필터링을 사용하는 새로운 최적화 알고리즘인 LPF-SGD를 제안한다. 가우시안 커널을 사용한 컨볼루션을 통해 손실을 스무딩하고, 필터링된 기울기를 최적화함으로써 LPF-SGD는 SGD와 SAM과 같은 최신 기법들보다 뛰어난 일반화 성능을 달성하며, 일반화 오차가 낮은 해로의 수렴 보장을 이행한다.

ABSTRACT

In this paper, we study the sharpness of a deep learning (DL) loss landscape around local minima in order to reveal systematic mechanisms underlying the generalization abilities of DL models. Our analysis is performed across varying network and optimizer hyper-parameters, and involves a rich family of different sharpness measures. We compare these measures and show that the low-pass filter-based measure exhibits the highest correlation with the generalization abilities of DL models, has high robustness to both data and label noise, and furthermore can track the double descent behavior for neural networks. We next derive the optimization algorithm, relying on the low-pass filter (LPF), that actively searches the flat regions in the DL optimization landscape using SGD-like procedure. The update of the proposed algorithm, that we call LPF-SGD, is determined by the gradient of the convolution of the filter kernel with the loss function and can be efficiently computed using MC sampling. We empirically show that our algorithm achieves superior generalization performance compared to the common DL training strategies. On the theoretical front, we prove that LPF-SGD converges to a better optimal point with smaller generalization error than SGD.

연구 동기 및 목표

  • 딥러닝의 일반화 성능과 상관관계가 높은 손실 경계면의 날카움 측정치 중 가장 강력하고 예측 가능한 것을 규명하는 것.
  • 발견된 날카움 측정치를 활용해 평탄한 최소값을 능동적으로 추구하는 최적화 알고리즘을 개발하는 것.
  • LPF-SGD가 표준 SGD보다 일반화 오차가 낮은 해로 수렴하는 이론적 수렴 보장을 제공하는 것.
  • 다양한 아키텍처와 하이퍼파라미터 설정에서 기존 기법들, 특히 SAM과 비교해 제안된 방법이 더 뛰어난 일반화 성능을 보임을 실증적으로 검증하는 것.

제안 방법

  • 논문은 손실 함수를 가우시안 커널과 컨볼루션하여 저역통과 필터를 적용한 날카움 측정치를 도입한다. 이는 局소 변동성을 스무딩하고 손실 경계면의 넓고 평탄한 영역을 강조한다.
  • LPF-SGD 알고리즘은 몬테카를로 샘플링을 사용해 스무딩된 손실 함수의 기울기를 계산하여 고차원 매개변수 공간에서의 효율적 최적화를 가능하게 한다.
  • 이 방법은 평탄한 최소값(저역통과 기반 날카움 측정치로 식별)이 일반화 성능 향상과 관련이 있다는 가설에 기반하며, 따라서 학습 과정을 이러한 영역으로 유도한다.
  • 이론적 분석을 통해 부드러움과 리프시츠 연속성에 대한 온건한 가정 하에, LPF-SGD가 표준 SGD보다 일반화 오차가 작은 해로 수렴함을 증명한다.
  • 알고리즘은 스킵 연결과 배치 정규화 유무, 다양한 네트워크 너비, 다양한 최적화기 하이퍼파라미터(학습률, 배치 크기, 가중치 감쇠, 모멘타임)를 고려해 다양한 네트워크 아키텍처에서 평가된다.
  • 저역통과 기반 날카움 측정치는 여러 기존 날카움 지표와 비교되어, 테스트 정확도와의 상관관계가 더 높고 데이터 및 레이블 노이즈에 대해 더 강건함을 실증적으로 입증한다.

실험 결과

연구 질문

  • RQ1다양한 아키텍처와 하이퍼파라미터 설정에서 딥러닝 모델의 일반화 성능을 가장 정확하게 예측하는 날카움 측정치는 무엇인가?
  • RQ2손실 경계면의 저역통과 필터링을 활용해 일반화 성능을 향상시키는 실용적인 최적화 알고리즘을 설계할 수 있는가?
  • RQ3LPF-SGD는 표준 SGD와 SAM과 같은 최신 기법보다 더 뛰어난 일반화 성능을 보이는가?
  • RQ4데이터 및 레이블 노이즈 하에서 저역통과 기반 날카움 측정치는 어떻게 행동하며, 모델 용량 증가에 따라 테스트 정확도의 더블 디센트 현상을 잘 반영하는가?
  • RQ5LPF-SGD에 대해 수렴성과 일반화 오차 측면에서 어떤 이론적 보장을 설정할 수 있는가?

주요 결과

  • 저역통과 기반 날카움 측정치는 평가된 모든 모델과 하이퍼파라미터 설정에서 일반화 성능과 가장 높은 상관관계를 보이며, 기존 날카움 지표를 능가한다.
  • LPF-SGD 알고리즘은 다양한 벤치마크 데이터셋과 네트워크 아키텍처에서 표준 SGD 및 최신 기술인 SAM보다 뛰어난 테스트 정확도를 달성한다.
  • 저역통과 기반 측정치는 데이터 및 레이블 노이즈에 강건하며, 모델 용량 증가에 따라 테스트 정확도의 더블 디센트 행동을 성공적으로 추적한다.
  • 이론적 분석을 통해 LPF-SGD는 일반화 오차 경계가 표준 SGD보다 더 빠르게 감소하는 해로 수렴함을 보여주며, 일반화 오차 경계 비율은 $ O(1/T^{ ilde{p}-p}) $ 의 비율로 감소한다.
  • 필터 커널의 공분산 행렬의 최소 고유값이 충분히 크면 ($ \sigma_- > \alpha/\beta $), 필터 너비를 증가시킴으로써 일반화 오차 경계 비율이 감소함을 확인하여 일반화 성능 향상을 뒷받침한다.
  • 실증 결과는 LPF-SGD가 노이즈 있는 학습 조건 하에서도 일관되게 손실 경계면에서 더 평탄한 최소값을 찾는다는 것을 확인한다. 이러한 평탄한 최소값은 일반화 성능 향상과 관련이 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.