[논문 리뷰] Learning the Number of Neurons in Deep Networks
이 논문은 학습 중에 각 계층의 뉴런 수를 자동으로 결정하고 가지치기하기 위해 그룹 희소성 정규화를 도입하여, 과잉층 네트워크에서 시작해 매개변수를 크게 축소하고도 정확도를 유지하거나 향상시킨다.
Nowadays, the number of layers and of neurons in each layer of a deep network are typically set manually. While very deep and wide networks have proven effective in general, they come at a high memory and computation cost, thus making them impractical for constrained platforms. These networks, however, are known to have many redundant parameters, and could thus, in principle, be replaced by more compact architectures. In this paper, we introduce an approach to automatically determining the number of neurons in each layer of a deep network during learning. To this end, we propose to make use of structured sparsity during learning. More precisely, we use a group sparsity regularizer on the parameters of the network, where each group is defined to act on a single neuron. Starting from an overcomplete network, we show that our approach can reduce the number of parameters by up to 80\% while retaining or even improving the network accuracy.
연구 동기 및 목표
- 메모리 및 계산 비용 감소를 위한 계층 너비의 자동 결정 동기화.
- 학습 중 일부 뉴런 전체를 제거할 수 있는 정규화 학습 프레임워크 제안.
- 네트워크 매개변수와 뉴런 수를 사전 학습 없이 엔드-투-엔드로 학습 가능하게 함.
- ImageNet 및 ICDAR에서 대규모 데이터셋과 아키텍처에 대한 확장성 시연.
제안 방법
- 계층의 뉴런을 매개변수의 그룹으로 정의하고 몇몇 그룹을 0으로 만들도록 그룹 희소성 정규화를 적용.
- 그룹-노름과 L1 페널티를 결합한 희소한 그룹 Lasso 변형을 사용하여 그룹 수준과 그룹 내 희소성을 모두 촉진.
- 근사 그래디언트 하강법으로 최적화; 뉴런 그룹별로 근사 연산자를 적용해 전체 뉴런을 0으로 만듦.
- 과잉 완전 네트워크에서 시작해 학습 중에 반복적으로 뉴런을 가지치기하여 컴팩트한 아키텍처를 얻음.
- 정규화 변형 두 가지 실험: Eq. (2) 그룹 희소성과 Eq. (3) alpha 매개변수가 있는 희소 그룹 Lasso.
실험 결과
연구 질문
- RQ1그룹 희소성 정규화가 학습 중에 계층당 뉴런 수를 자동으로 줄일 수 있는가?
- RQ2대규모 데이터에서 정확도를 희생하지 않고 매개변수를 얼마나 줄일 수 있는가?
- RQ3본 방법이 서로 다른 아키텍처와 데이터셋(ImageNet, Places2, ICDAR)에서 일반화되는가?
- RQ4가지치기된 네트워크의 테스트 시 이점(속도 및 메모리)은 무엇인가?
- RQ5계층 간 정규화 하이퍼파라미터에 방법이 얼마나 민감한가?
주요 결과
- 과잉 완전 네트워크에서 시작하여 매개변수를 최대 80%까지 줄일 수 있다.
- 대부분의 방법이 가지치기 후 Top-1 정확도를 유지하거나 향상시키며, 일부 설정에서 ImageNet에서 최대 2.45%의 이득을 보인다.
- BNet C의 GS는 12.7%의 뉴런 감소와 27.4%의 전체 매개변수 감소를 달성하면서도 정확도를 기준선보다 1.6% 이내로 유지한다.
- 더 큰 초기 너비(M=640/768)에서 12월 8일은 19–26%의 뉴런 감소와 최대 48%의 매개변수 감소를 보이며 정확도는 기준선에 비해 비슷하거나 더 우수하다.
- ICDAR에서 Dec 3의 GS/SGL은 매개변수를 최대 80%까지 줄이고 MaxPool/MaxOut 기반선보다 정확도를 개선할 수 있다.
- 테스트 시 가지치기된 네트워크는 일부 경우에서 최대 약 50%의 속도 향상과 매개변수에서 최대 82%의 메모리 절감을 보여준다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.