Skip to main content
QUICK REVIEW

[논문 리뷰] Global Optimality Beyond Two Layers: Training Deep ReLU Networks via Convex Programs

Tolga Ergen, Mert Pilancı|arXiv (Cornell University)|2021. 10. 11.
Sparse and Compressive Sensing Techniques인용 수 5
한 줄 요약

이 논문은 다중 세 Layer로 구성된 서브 네트워크를 가진 딥 ReLU 네트워크의 훈련을 그룹 l1-노름 정규화를 통해 전역적으로 해결 가능한 볼록 최적화 문제로 정확히 재구성하는 볼록 최적화 프레임워크를 제안한다. 고정된 너비를 가진 네트워크에 대해 다항 시간 내에 전역 최적화가 가능하다는 것을 증명하며, 볼록 쌍대성에 의해 숨겨진 희소성 유도 은닉 정규화 메커니즘이 드러난다.

ABSTRACT

Understanding the fundamental mechanism behind the success of deep neural networks is one of the key challenges in the modern machine learning literature. Despite numerous attempts, a solid theoretical analysis is yet to be developed. In this paper, we develop a novel unified framework to reveal a hidden regularization mechanism through the lens of convex optimization. We first show that the training of multiple three-layer ReLU sub-networks with weight decay regularization can be equivalently cast as a convex optimization problem in a higher dimensional space, where sparsity is enforced via a group $\ell_1$-norm regularization. Consequently, ReLU networks can be interpreted as high dimensional feature selection methods. More importantly, we then prove that the equivalent convex problem can be globally optimized by a standard convex optimization solver with a polynomial-time complexity with respect to the number of samples and data dimension when the width of the network is fixed. Finally, we numerically validate our theoretical results via experiments involving both synthetic and real datasets.

연구 동기 및 목표

  • 성공적인 딥 ReLU 네트워크 훈련 배경에 있는 은닉 정규화 메커니즘을 이해하기 위해.
  • 비볼록 딥 네트워크 훈련을 볼록 최적화 문제로 변환하는 통합 프레임워크를 개발하기 위해.
  • 고정된 네트워크 너비에 대해 등가의 볼록 문제를 다항 시간 내에 전역 최적화할 수 있음을 증명하기 위해.
  • 원래의 비볼록 아키텍처에서 활성 서브 네트워크의 수와 볼록 공식화에서의 희소성 간의 직접적인 맵핑을 수립하기 위해.
  • 이전의 두 레이어 볼록 재구성 결과를 임의의 볼록 손실 함수와 가중치 감소 정규화를 갖는 더 깊은, 다중 서브 네트워크 아키텍처로 일반화하기 위해.

제안 방법

  • 다중 세 Layer 서브 네트워크를 가진 딥 ReLU 네트워크 훈련 문제를 가중치 감소 정규화를 포함한 비볼록 최적화 문제로 공식화한다.
  • 볼록 쌍대성 기법을 적용하여, 서브 네트워크 파라미터에 대해 그룹 l1-노름 정규화를 통해 희소성을 강제하는 더 높은 차원의 공간에서 등가의 볼록 문제를 유도한다.
  • 펜첼 쌍대성 기법을 사용하여 이중 문제를 유도하며, 원래 문제와 볼록 공식화 간의 강한 쌍대성과 정확한 등가성을 보장한다.
  • 비볼록 문제와 볼록 문제 간의 등가성을 가능하게 하는 스케일링 변환(보조정리 1)을 도입한다.
  • 네트워크 너비가 고정되어 있을 경우, 샘플 수와 데이터 차원에 대해 다항 시간 내에 등가의 볼록 문제를 전역 최적화할 수 있음을 증명한다.
  • 행렬 F-노름 정규화와 추적 기반 펜첼 쌍대 함수를 사용하여 다중 출력으로의 프레임워크 확장을 수행한다.

실험 결과

연구 질문

  • RQ1다중 세 Layer로 구성된 ReLU 서브 네트워크를 가진 딥 네트워크 훈련을 정확히 볼록 최적화 문제로 재구성할 수 있는가?
  • RQ2딥 ReLU 네트워크의 성공 배경에 있는 은닉 정규화 메커니즘은 무엇이며, 이를 명시적으로 기술할 수 있는가?
  • RQ3볼록 재구성은 원래의 비볼록 문제에 대해 다항 시간 내에 전역 최적화를 가능하게 하는가?
  • RQ4볼록 공식화에서의 희소성은 원래 아키텍처의 활성 서브 네트워크 수와 어떻게 관련이 있는가?
  • RQ5이 프레임워크는 임의의 볼록 손실 함수와 가중치 감소 정규화로 일반화될 수 있는가?

주요 결과

  • 가중치 감소 정규화를 포함한 다중 세 Layer ReLU 서브 네트워크 훈련은 그룹 l1-노름 정규화를 통해 더 높은 차원의 공간에서 정확히 등가의 볼록 최적화 문제로 재구성된다.
  • 네트워크 너비가 고정되어 있을 경우, 등가의 볼록 문제를 샘플 수와 데이터 차원에 대해 다항 시간 내에 전역 최적화할 수 있다.
  • 볼록 공식화에서의 희소성은 원래의 비볼록 아키텍처에서 활성 서브 네트워크 수의 감소와 직접적으로 대응된다.
  • 은닉 정규화 메커니즘은 그룹 l1-노름 정규화로 드러나며, 이는 고차원 공간에서의 특징 선택을 촉진한다.
  • 이 프레임워크는 이전의 두 레이어 볼록 재구성 결과를 제곱 오차, 교차 엔트로피, 허프 손실 등 임의의 볼록 손실 함수를 포함한 더 깊은 아키텍처로 일반화한다.
  • 합성 및 실제 데이터셋에 대한 수치 실험을 통해 이론적 등가성과 볼록 최적화 접근의 효과성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.