Skip to main content
QUICK REVIEW

[논문 리뷰] Convergence of a Relaxed Variable Splitting Method for Learning Sparse Neural Networks via $\ell_1, \ell_0$, and transformed-$\ell_1$ Penalties

Thu Dinh, Jack Xin|arXiv (Cornell University)|2018. 12. 13.
Machine Learning and ELM참고 문헌 24인용 수 5
한 줄 요약

이 논문은 $\beta$-정규화된 $Â𝕎_1$, $Â𝕎_0$, 및 변환된 $Â𝕎_1$ 페널티 하에 희소한 한 은닉층 ReLU 컨볼루션 신경망을 훈련하기 위해 임계값 처리와 경사하강법을 조합한 이완 변수 분할 방법(RVSM)을 제안한다. 가우시안 입력 하에서 진짜 가중치 벡터에 가까운 한 경계점으로의 전역 수렴을 높은 확률로 증명하며, 새로운 임계값 처리 연산을 통해 훈련 중 희소성이 자연스럽게 발생한다.

ABSTRACT

Sparsification of neural networks is one of the effective complexity reduction methods to improve efficiency and generalizability. We consider the problem of learning a one hidden layer convolutional neural network with ReLU activation function via gradient descent under sparsity promoting penalties. It is known that when the input data is Gaussian distributed, no-overlap networks (without penalties) in regression problems with ground truth can be learned in polynomial time at high probability. We propose a relaxed variable splitting method integrating thresholding and gradient descent to overcome the lack of non-smoothness in the loss function. The sparsity in network weight is realized during the optimization (training) process. We prove that under $\ell_1, \ell_0$; and transformed-$\ell_1$ penalties, no-overlap networks can be learned with high probability, and the iterative weights converge to a global limit which is a transformation of the true weight under a novel thresholding operation. Numerical experiments confirm theoretical findings, and compare the accuracy and sparsity trade-off among the penalties.

연구 동기 및 목표

  • 비연속적인 희소성 유도 페널티 하에서 ReLU 활성화를 갖는 희소한 한 은닉층 컨볼루션 신경망을 훈련하기 위한 증명 가능하게 수렴하는 방법을 개발하는 것.
  • 표준 경사하강법이 원점에서 비연속성으로 인해 저해되는 문제를 변수 분할 프레임워크에 임계값 처리를 통합함으로써 해결하는 것.
  • 신경망 희소화의 맥락에서 $ÂWnd_1$, $ÂWnd_0$, 및 변환된 $ÂWnd_1$ 페널티에 대한 이론적 수렴 보장을 수립하는 것.
  • 후행적 프루닝 없이도 최적화 과정에서 희소성이 자연스럽게 발생함을 보여주는 것.
  • VGG-16과 ResNet18에서 실험적으로 방법을 검증하여 페널티 간의 정확도 및 희소성 트레이드오프를 비교하는 것.

제안 방법

  • 비연속성 문제를 다루기 위해 가중치 갱신을 경사하강 단계와 임계값 처리 연산으로 분리하는 이완 변수 분할 방법(RVSM)을 제안한다.
  • $ÂWnd_1$, $ÂWnd_0$, 및 변환된 $ÂWnd_1$ 페널티 항을 통합하여 네트워크 가중치의 희소성을 유도하는 라그랑주 수식을 사용한다.
  • $ÂWnd_0$ 페널티의 모레우 환경에서 유도된 새로운 임계값 처리 연산을 사용하여 비볼록 희소성을 근사하면서도 미분 가능성을 유지한다.
  • 가중치 공간 내 각도와 내림값 성질에 기반한 기하적 추론을 통해 원점에서의 비미분 가능성에도 불구하고 수렴을 증명한다.
  • 가우시안 입력 분포 하의 인구 손실 함수에 방법을 적용하며, 손실 곡면의 알려진 기하적 성질을 활용한다.
  • 각 층을 독립적으로 다루는 방식으로 깊은 신경망에 대한 방법을 적응시켜 VGG-16과 ResNet18에 적용 가능하게 한다.

실험 결과

연구 질문

  • RQ1$ÂWnd_1$, $ÂWnd_0$, 및 변환된 $ÂWnd_1$ 페널티 하에서 이완 변수 분할 방법에 임계값 처리와 경사하강법을 통합한 RVSM이 희소 신경망 훈련에 대해 전역 수렴할 수 있는가?
  • RQ2제안된 RVSM 방법은 후행적 프루닝 없이도 훈련 중에 희소성을 달성할 수 있으며, 가우시안 데이터 하에서 진짜 가중치 벡터를 높은 확률로 복원할 수 있는가?
  • RQ3$ÂWnd_1$, $ÂWnd_0$, 및 변환된 $ÂWnd_1$ 페널티 간의 수렴 행동과 최종 희소성은 정확도 및 희소성 트레이드오프 측면에서 어떻게 비교되는가?
  • RQ4RVSM 방법은 VGG-16과 ResNet18와 같은 더 깊은 신경망으로 확장 가능하며, 희소성과 성능을 유지할 수 있는가?
  • RQ5제안된 방법 하에서 한계 가중치 벡터와 진짜 가중치 간의 이론적 오차 한계는 무엇인가?

주요 결과

  • RVSM 방법은 가우시안 입력 하에서 높은 확률로 진짜 가중치 벡터의 변환된 형태인 전역 한계점으로 수렴함을 증명하며, 이는 새로운 임계값 처리 연산에 의해 결정된다.
  • 한계 가중치 벡터는 진짜 가중치 $\boldsymbol{w}^*$로부터 $O(k\beta\sin\gamma)$ 이내에 있으며, 기준값으로부터의 정량적 오차 추정을 확립한다.
  • VGG-16에서의 수치 실험 결과, $ÂWnd_0$ 정규화가 중간 정도의 정확도 손실(92.54%)로 가장 높은 희소성(86.89%)을 달성한 반면, $ÂWnd_1$은 높은 정확도(93.7%)를 유지하면서 35.68%의 희소성 수준을 확보했다.
  • ResNet18에서 RVSM에 $ÂWnd_0$ 정규화를 적용한 결과, 정확도가 94.89% vs. 94.84%로 유사한 수준을 유지하면서도 ADMM보다 훨씬 높은 희소성(93.70% vs. 47.08%)을 달성했다.
  • 이 방법은 층 단위로 독립적인 희소화를 가능하게 하여 아키텍처 변경 없이도 깊은 신경망에 적용 가능하다.
  • 이론적 수렴은 원점에서의 비연속성 문제를 극복하기 위해 각도와 내림값 성질에 기반한 기하적 추론에 의존한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.