Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Neural Networks with Adaptive Regularization

Han Zhao, Yao-Hung Hubert Tsai|arXiv (Cornell University)|2019. 07. 14.
Neural Networks and Applications참고 문헌 40인용 수 8
한 줄 요약

이 논문은 깊이 신경망을 위한 적응형 정규화 방법인 AdaReg을 제안한다. 이 방법은 크로네커 곱으로 구조화된 공분산을 가진 행렬변량정규 prior를 사용하여 데이터에 의존하는 상관관계를 통해 뉴런 간 통계적 강도를 공유하도록 유도한다. 블록 좌표 강하법를 사용하여 데이터로부터 prior의 초모수를 학습함으로써 스펙트럴 노름과 안정적 랭크를 감소시켜 소규모 데이터셋에서 더 나은 일반화 성능을 달성한다.

ABSTRACT

Feed-forward neural networks can be understood as a combination of an intermediate representation and a linear hypothesis. While most previous works aim to diversify the representations, we explore the complementary direction by performing an adaptive and data-dependent regularization motivated by the empirical Bayes method. Specifically, we propose to construct a matrix-variate normal prior (on weights) whose covariance matrix has a Kronecker product structure. This structure is designed to capture the correlations in neurons through backpropagation. Under the assumption of this Kronecker factorization, the prior encourages neurons to borrow statistical strength from one another. Hence, it leads to an adaptive and data-dependent regularization when training networks on small datasets. To optimize the model, we present an efficient block coordinate descent algorithm with analytical solutions. Empirically, we demonstrate that the proposed method helps networks converge to local optima with smaller stable ranks and spectral norms. These properties suggest better generalizations and we present empirical results to support this expectation. We also verify the effectiveness of the approach on multiclass classification and multitask regression problems with various network structures.

연구 동기 및 목표

  • 소규모 데이터셋에서 훈련할 때 깊이 신경망의 과적합 문제를 해결하기 위해 데이터에 의존하는 정규화를 도입하기 위해.
  • 역전파를 통해 같은 레이어 내 뉴런 간 상관관계를 활용하여 통계적 효율성을 향상시키기 위해.
  • 모델 가중치와 사전분포의 공분산 구조를 모두 학습하는 확장 가능한 최적화 방법을 개발하기 위해.
  • 학습된 모델의 스펙트럴 노름과 안정적 랭크를 줄여 일반화 성능 향상을 입증하기 위해.
  • 고정된 사전분포를 피하고 경험베이즈 기반의 원리적인, 적응형 정규화 프레임워크를 제공하기 위해.

제안 방법

  • 가중치에 대해 크로네커 곱으로 구조화된 공분산을 가진 행렬변량정규 사전분포를 제안하여 뉴런 간 상관관계를 모델링하기 위해.
  • 경험베이즈 원리를 사용하여 데이터로부터 사전분포의 초모수를 학습함으로써 데이터에 의존하는 정규화를 가능하게 하기 위해.
  • 모델 가중치와 사전분포의 행/열 공분산 행렬을 번갈아가며 업데이트하는 효율적인 블록 좌표 강하 알고리즘을 도출하기 위해.
  • 가중치와 공분산 업데이트에 대해 분석적 해를 제공하여 근사 오차를 방지하기 위해.
  • 역전파에서 기울기 업데이트의 랭크-1 구조를 활용하여 크로네커 분해를 자연스러운 모델링 선택으로 정당화하기 위해.
  • 우도와 사전분포의 공동 목표를 볼록 해석 도구를 사용하여 최적화하여 수렴성을 보장하기 위해.

실험 결과

연구 질문

  • RQ1데이터에 의존하는, 적응형 정규화 방법이 소규모 데이터셋에서 훈련된 딥 네트워크의 일반화 성능을 향상시킬 수 있는가?
  • RQ2크로네커 구조를 가진 사전분포를 통해 가중치 행렬 내 뉴런 간 상관관계를 모델링하면 최적화 및 일반화 성능 향상에 기여하는가?
  • RQ3사전분포의 공분산을 고정하는 대신 데이터로부터 학습하는 것이 기존 정규화 기법보다 성능 향상에 기여하는가?
  • RQ4제안된 방법이 학습된 가중치 행렬의 스펙트럴 노름과 안정적 랭크를 줄여 일반화 성능 향상의 신호가 되는가?
  • RQ5소규모 데이터 작업에서 표준 기준 기법들인 가중치 감쇠, 드롭아웃, 배치 정규화와 비교해 적응형 정규화는 어떻게 성능을 냈는가?

주요 결과

  • AdaReg는 학습된 가중치 행렬의 스펙트럴 노름과 안정적 랭크를 감소시켜 일반화 능력 향상을 나타낸다.
  • 다중 클래스 분류 및 다중 작업 회귀 작업에서 소규모 훈련 데이터 조건에서도 더 나은 일반화 성능을 달성한다.
  • 실험 결과에 따르면 같은 레이어 내 뉴런들이 상호 연관된 가중치 업데이트를 보이며, 모델의 공통 통계적 강도 가정과 일치한다.
  • 학습된 사전분포 공분산 행렬은 의미 있는 구조를 보이며, 유사한 숫자(예: 1과 7)는 양의 상관관계를, 비슷하지 않은 숫자(예: 1과 8)는 음의 상관관계를 보인다.
  • 닫힌 형태의 업데이트를 사용하여 효율적으로 수렴하는 최적화 알고리즘이며, 근사 오차 없이 확장 가능한 훈련이 가능하다.
  • 소규모 데이터 환경에서 표준 정규화 기법들보다 성능이 뛰어나, 적응형이며 데이터 기반 사전분포의 이점을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.