Skip to main content
QUICK REVIEW

[논문 리뷰] S-SGD: Symmetrical Stochastic Gradient Descent with Weight Noise Injection for Reaching Flat Minima

Wonyong Sung, Iksoo Choi|arXiv (Cornell University)|2020. 09. 05.
Advanced Neural Network Applications참고 문헌 44인용 수 5
한 줄 요약

이 논문은 깊이 있는 신경망의 가중치에 고정된 크기의 대칭 노이즈를 주입하여 평탄한 최소값으로 수렴하도록 유도하는 정규화 방법인 대칭 확률적 경사하강법(S-SGD)을 제안한다. 두 개의 변형된 가중치 점에서 손실를 평가함으로써 S-SGD는 훈련을 안정화시키고 일반화 성능을 향상시키며, CNN, RNN 및 음성 인식 작업 전반에서 표준 SGD, 드롭아웃, 드롭커넥트보다 뛰어난 성능을 보이며 일관된 정확도 향상을 제공한다.

ABSTRACT

The stochastic gradient descent (SGD) method is most widely used for deep neural network (DNN) training. However, the method does not always converge to a flat minimum of the loss surface that can demonstrate high generalization capability. Weight noise injection has been extensively studied for finding flat minima using the SGD method. We devise a new weight-noise injection-based SGD method that adds symmetrical noises to the DNN weights. The training with symmetrical noise evaluates the loss surface at two adjacent points, by which convergence to sharp minima can be avoided. Fixed-magnitude symmetric noises are added to minimize training instability. The proposed method is compared with the conventional SGD method and previous weight-noise injection algorithms using convolutional neural networks for image classification. Particularly, performance improvements in large batch training are demonstrated. This method shows superior performance compared with conventional SGD and weight-noise injection methods regardless of the batch-size and learning rate scheduling algorithms.

연구 동기 및 목표

  • 딥 네ural 네트워크(DNN) 훈련에서 과적합과 일반화 성능 열악함을 해결하기 위해 평탄한 최소값으로 수렴하도록 촉진하는 것.
  • 손실 표면의 평탄함을 명시적으로 측정하는 새로운 정규화 기법을 통해 훈련 안정성과 일반화 성능을 향상시키는 것.
  • 완전 연결, 컨볼루션 및 순환 레이어에 모두 적용 가능한 단순하고 유연하며 효과적인 방법을 개발하는 것.
  • 헤시안 기반의 기울기 갱신을 활용하여 가중치 및 데이터 변형에 대한 강건성을 향상시키는 훈련 알고리즘을 제공하는 것.

제안 방법

  • S-SGD는 각 업데이트 단계에서 네트워크 가중치에 고정 크기의 대칭 노이즈를 주입하며, 변형된 가중치 점과 원본 가중치 점에서 손실를 계산한다.
  • 알고리즘은 두 개의 대칭 점 w + ε 및 w - ε에서 손실를 평가하여 손실 표면의 평탄함을 추정한다. 여기서 ε는 고정된 노이즈 벡터이다.
  • 가중치 갱신은 두 변형된 점에서의 평균 기울기 기반으로 계산되며, 이는 갱신 규칙에 헤시안 정보를 효과적으로 통합한다.
  • 이 방법은 곡률이 높은 영역에서 손실 변화가 증가함으로써 날카로운 최소값을 페널티 처리함으로써 평탄한 최소값을 선호하도록 설계되어 있다.
  • 표준 SGD와 호환되며, 아키텍처 변경 없이 완전 연결, 컨볼루션 및 순환 레이어에 모두 적용 가능하다.
  • 대칭적 변형을 통한 유한차분 유사 근사 방법을 사용함으로써 헤시안 계산의 계산 비용을 피한다.

실험 결과

연구 질문

  • RQ1대칭적 가중치 노이즈 주입이 평탄한 최소값 수렴을 유도함으로써 DNN 훈련의 일반화 성능 향상에 기여할 수 있는가?
  • RQ2S-SGD는 드롭아웃 및 드롭커넥트와 같은 전통적인 정규화 기법과 비교해 테스트 정확도 및 강건성 측면에서 어떻게 성능을 내는가?
  • RQ3고정 크기의 대칭 노이즈는 무작위 노이즈 주입에 비해 훈련 안정성과 손실 표면의 평탄함을 향상시키는가?
  • RQ4S-SGD는 CNN, RNN 및 게이트형 컨볼루션넷을 포함한 다양한 아키텍처에서 성능 향상에 얼마나 기여하는가?
  • RQ5손실 표면 시각화 및 헤시안 고유값 분석을 통해 S-SGD가 날카로운 최소값과 과적합을 효과적으로 피할 수 있는가?

주요 결과

  • ResNet20를 사용한 CIFAR-10에서 S-SGD는 92.62%의 테스트 정확도를 달성하였으며, 동일한 설정에서 SGD(92.17%)와 드롭커넥트(92.18%)를 모두 초월하였다.
  • CIFAR-100에서 S-SGD는 125 에포크 후 69.63%의 테스트 정확도를 기록하였으며, SGD(68.51%) 및 정밀 조정을 적용한 SGD(68.51%)를 모두 뛰어넘었다.
  • 손실 표면 시각화 결과 S-SGD는 손실 분지의 중심 근처에 평탄한 영역으로 수렴하는 것으로 나타났으며, 날카로운 최소값과 관련된 기름지지 않은 벽을 피하고 있었다.
  • 헤시안 고유값 분석 결과 S-SGD로 훈련된 모델은 낮은 최대 고유값을 보이며, 이는 평탄한 최소값과 더 나은 일반화 성능을 의미한다.
  • 게이트형 컨볼루션넷을 사용한 종단 간 음성 인식 작업에서 S-SGD는 기준 SGD 및 노이즈 주입 방법보다 일관된 성능 향상을 보였다.
  • S-SGD는 훈련 손실가 날카로운 손실 벽에서 더 멀리 위치해 있음을 통해 더 높은 안정성과 강건성을 보였으며, 이는 과적합 감소를 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.