QUICK REVIEW
[논문 리뷰] Theory of Deep Learning IIb: Optimization Properties of SGD
Chiyuan Zhang, Qianli Liao|arXiv (Cornell University)|2018. 01. 07.
Domain Adaptation and Few-Shot Learning참고 문헌 1인용 수 45
한 줄 요약
이 논문은 과초파라미터화된 심층 신경망에서 SGD/SGDL를 분석하여 노이즈 주도 SGD가 평탄하고 부피가 큰 미니마에 집중하며 종종 전역 미니마가 된다는 것을 이론과 실험으로 뒷받침하고, 자연 라벨과 임의 라벨의 차이를 대조한다.
ABSTRACT
In Theory IIb we characterize with a mix of theory and experiments the optimization of deep convolutional networks by Stochastic Gradient Descent. The main new result in this paper is theoretical and experimental evidence for the following conjecture about SGD: SGD concentrates in probability -- like the classical Langevin equation -- on large volume, "flat" minima, selecting flat minimizers which are with very high probability also global minimizers
연구 동기 및 목표
- 심층 학습에서 수렴을 넘어 최적화의 이해를 촉진하고, 과초파라미터화된 네트워크에서 미니마를 형성하는 데 있어 SGD의 역할에 초점을 맞춘다.
- SGD 동역학을 Langevin형 거동과 볼츠만 분포와 이론적으로 연결하여 평탄한 미니마 선택을 설명한다.
- 자연 라벨과 임의 라벨을 비교하여 미니마의 평탄성 및 일반화 측면을 실증적으로 보여준다.
제안 방법
- 확률적 경사 하강법(SGD)을 기울기 노이즈를 xi_t로 모델링하는 확률적 최적화 과정으로 모델링하고 f_{t+1} = f_t - gamma_t(nabla I_{S_n}(f_t) + xi_t)로 보인다.
- SGD를 볼츠만 분포 p(f) ~ exp(-U/T)로 연결하기 위해 Langevin 역학을 도입한다.
- SGDL가 열악한(degeneracy)한(평탄한) 미니마를 선호하고, 깊이가 같은 미니마들 중에서도 더 큰 부피를 가진 미니마를 선호한다고 주장한다(특히 고차원에서).
- CIFAR-10 및 MNIST에서 미니마 주변의 풍경 평탄도(flatness)를 양자화하기 위해 각 방향의 등방성 평탄도 테스트와 세 점 보간(interpolation)을 사용한다.
- 자연 라벨 설정과 임의 라벨 설정 사이를 비교하여 자연 라벨에서 더 큰 평탄 영역이 나타남을 보여준다.
- 평탄한 미니마와 강건한 최적화/마진(이론 III에서 자세히 다룸) 사이의 질적 연관성을 제공한다.
실험 결과
연구 질문
- RQ1과초파라미터화된 심층 신경망에서 SGD가 평탄하고 큰 부피의 미니마에 집중하는가?
주요 결과
- SGD는 미니배치에서의 기울기 노이즈로 인해 이산화된 Langevin 확산처럼 동작한다.
- SGDL에 의해 유도된 점근적 볼츠만 분포는 더 평탄하고 큰 부피의 미니마에 집중하며 같은 깊이에서의 축 다발성(degeneracy)을 선호한다.
- 고차원에서 더 큰 등방성 평탄 영역을 가진 미니마가 SGDL 하에서 더 가능성이 높아지며, 평탄하고 강건한 해에 편향되는 것으로 보인다.
- 실험은 자연 라벨 설정에서 미니마 주변의 더 큰 평탄 영역을 보이며 이는 평탄도 테스트로 정량화된다.
- 과초파라미터화된 규칙에서 0오차 해는 보통 평탄한 영역에 위치하는 경향이 있으며, 더 깊고 축에 정렬된 미니마는 또한 평탄한 경우가 아니면 선호되지 않는다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.