Skip to main content
QUICK REVIEW

[논문 리뷰] 0/1 Deep Neural Networks via Block Coordinate Descent

Hui Zhang, Shenglong Zhou|arXiv (Cornell University)|2022. 06. 19.
Machine Learning and Algorithms인용 수 4
한 줄 요약

이 논문은 0/1 단계 함수를 활성화 함수로 사용하여 딥 네ural 네트워크를 훈련하기 위한 블록 좌표 강하(BCD) 알고리즘을 제안한다. 이는 기존 백프로파게이션에서 발생하는 기울기 소실 문제를 극복한다. 0/1 DNN를 비제약 최적화 문제로 재정의하고, 하위 문제에 대한 닫힌 형태의 해를 활용함으로써, ℓ₂,₀-정규화를 통해 FLOPs와 모델 크기를 줄이며 MNIST, 패션MNIST, CIFAR-10, CIFAR-100에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

The step function is one of the simplest and most natural activation functions for deep neural networks (DNNs). As it counts 1 for positive variables and 0 for others, its intrinsic characteristics (e.g., discontinuity and no viable information of subgradients) impede its development for several decades. Even if there is an impressive body of work on designing DNNs with continuous activation functions that can be deemed as surrogates of the step function, it is still in the possession of some advantageous properties, such as complete robustness to outliers and being capable of attaining the best learning-theoretic guarantee of predictive accuracy. Hence, in this paper, we aim to train DNNs with the step function used as an activation function (dubbed as 0/1 DNNs). We first reformulate 0/1 DNNs as an unconstrained optimization problem and then solve it by a block coordinate descend (BCD) method. Moreover, we acquire closed-form solutions for sub-problems of BCD as well as its convergence properties. Furthermore, we also integrate $\ell_{2,0}$-regularization into 0/1 DNN to accelerate the training process and compress the network scale. As a result, the proposed algorithm has a high performance on classifying MNIST and Fashion-MNIST datasets. As a result, the proposed algorithm has a desirable performance on classifying MNIST, FashionMNIST, Cifar10, and Cifar100 datasets.

연구 동기 및 목표

  • 비차별 가능한 활성화 함수인 0/1 단계 함수를 사용하여 딥 네ural 네트워크를 훈련하는 알고리즘을 개발한다.
  • 기울기 기반 최적화에 의존하지 않고 단계 함수와 관련된 기울기 소실 문제를 해결한다.
  • ℓ₂,₀-정규화를 통합하여 네트워크의 희소성과 모델 크기 및 계산 비용을 감소시킨다.
  • 0/1 DNN의 이미지 분류 작업에서의 효과성을 입증한다. 이는 적대적 노이즈에 대해 강건하며 경쟁 가능한 성능을 보인다.

제안 방법

  • 0/1 DNN 훈련 문제를 평균 제곱오차와 ℓ₂,₀-정규화를 조합한 손실 함수를 포함하는 비제약 최적화 문제로 재정의한다.
  • 기타 가중치 행렬을 고정한 채 각 가중치 행렬 W_i를 번갈아가며 최적화하는 블록 좌표 강하(BCD) 방법을 적용한다.
  • BCD 업데이트의 각 하위 문제에 대해 닫힌 형태의 해를 유도함으로써 기울기 계산 없이도 효율적이고 안정적인 최적화를 가능하게 한다.
  • 단계 함수(0/1 활성화)와 하드맥스 레이어를 사용하여 이산 출력을 생성함으로써 이진 뉴런 동작을 보장한다.
  • 각 가중치 행렬의 비영 컬럼 수를 페널티로 삼아 희소성을 유도하기 위해 ℓ₂,₀-정규화를 통합한다.
  • 이론적 분석를 통해 수렴 보장을 확보한, 가중치 행렬 간 교대 최소화를 통한 알고리즘을 구현한다.

실험 결과

연구 질문

  • RQ1비기울기 기반 최적화 방법인 BCD가 불연속적인 0/1 활성화 함수를 갖는 딥 네ural 네트워크를 효과적으로 훈련시킬 수 있는가?
  • RQ2ℓ₂,₀-정규화의 통합이 0/1 DNN의 희소성과 일반화 성능에 어떤 영향을 미치는가?
  • RQ3BCD 훈련을 통해 0/1 DNN의 성능은 MNIST 및 CIFAR-10/100과 같은 표준 이미지 분류 벤치마크에서 어떻게 되는가?
  • RQ4ReLU 기반 모델과 비교해 볼 때 0/1 DNN는 입력 노이즈와 적대적 편향에 대해 얼마나 강건한가?
  • RQ50/1 DNN는 상당히 감소된 FLOPs와 모델 파라미터로 경쟁 가능한 정확도를 달성할 수 있는가?

주요 결과

  • BCD로 훈련된 0/1 DNN는 MNIST에서 상위 1 정확도 97.8%를 달성하여 ReLU 및 시그모이드 기반 베이스라인을 뛰어넘었다.
  • 패션MNIST에서는 오직 3,800개의 필터 파라미터로 상위 1 정확도 93.2%를 기록했으며, 표준 ReLU 네트워크 대비 FLOPs를 12% 감소시켰다.
  • CIFAR-10에서는 3,800개의 필터와 182.9M FLOPs로 상위 1 정확도 93.1%를 달성했으며, ReLU의 225.6M FLOPs보다 현저히 낮았다.
  • CIFAR-100에서는 3,990개의 필터 파라미터와 182.9M FLOPs로 상위 1 정확도 53.189%를 기록했으며, 이는 효율성과 확장성의 증거가 되었다.
  • 0/1 DNN는 가우시안 노이즈에 대해 뛰어난 강건성을 보였으며, 고수준의 노이즈에서도 안정적인 테스트 오차를 유지했고, 반면 ReLU 기반 모델은 자주 잘못 분류하는 경향을 보였다.
  • BCD 알고리즘은 신뢰성 있게 수렴했으며, STE, CCNN, PCNN, Bi-Real-Net와 같은 비교 방법들 중에서 가장 낮은 FLOPs를 기록하여 효율성을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.