Skip to main content
QUICK REVIEW

[논문 리뷰] DeepZero: Scaling up Zeroth-Order Optimization for Deep Model Training

Aochuan Chen, Yimeng Zhang|arXiv (Cornell University)|2023. 10. 03.
Adversarial Robustness in Machine LearningComputer Science인용 수 3
한 줄 요약

DeepZero는 깊이 있는 신경망(DNN)을 처음부터 훈련하기 위한 확장 가능한 제로차수(ZO) 최적화 프레임워크를 소개한다. 이는 이전의 정확도 및 효율성 한계를 극복한다. 좌표 기반 기울기 추정, 희소성 유도 프러닝, 전방 병렬화를 통한 특징 재사용을 활용함으로써, CIFAR-10의 ResNet-20에서 최신 기술 수준의 정확도를 달성하며, 일阶 최적화 성능에 가까워지며, 적대적 방어 및 PDE 오차 보정과 같은 실용적인 블랙박스 응용을 가능하게 한다.

ABSTRACT

Zeroth-order (ZO) optimization has become a popular technique for solving machine learning (ML) problems when first-order (FO) information is difficult or impossible to obtain. However, the scalability of ZO optimization remains an open problem: Its use has primarily been limited to relatively small-scale ML problems, such as sample-wise adversarial attack generation. To our best knowledge, no prior work has demonstrated the effectiveness of ZO optimization in training deep neural networks (DNNs) without a significant decrease in performance. To overcome this roadblock, we develop DeepZero, a principled ZO deep learning (DL) framework that can scale ZO optimization to DNN training from scratch through three primary innovations. First, we demonstrate the advantages of coordinatewise gradient estimation (CGE) over randomized vector-wise gradient estimation in training accuracy and computational efficiency. Second, we propose a sparsityinduced ZO training protocol that extends the model pruning methodology using only finite differences to explore and exploit the sparse DL prior in CGE. Third, we develop the methods of feature reuse and forward parallelization to advance the practical implementations of ZO training. Our extensive experiments show that DeepZero achieves state-of-the-art (SOTA) accuracy on ResNet-20 trained on CIFAR-10, approaching FO training performance for the first time. Furthermore, we show the practical utility of DeepZero in applications of certified adversarial defense and DL-based partial differential equation error correction, achieving 10-20% improvement over SOTA. We believe our results will inspire future research on scalable ZO optimization and contribute to advancing DL with black box. Codes are available at https://github.com/OPTML-Group/DeepZero.

연구 동기 및 목표

  • 딥 러닝을 위한 제로차수(ZO) 최적화의 확장성 격차를 해결함으로써, 이전 방법들이 큰 모델을 효과적으로 훈련하지 못하는 문제를 해결한다.
  • 고차원 DNN에서 유한차분 기반 ZO 기울기 추정의 높은 편향과 계산 비용 문제를 해결한다.
  • 계산 그래프나 역전파에 접근할 수 없는 환경에서도 종단 간 ZO 훈련을 가능하게 하여, 블랙박스 및 하드웨어 제약 조건이 있는 환경을 지원한다.
  • 실제 응용 분야에서 ZO 훈련의 실용성을 입증한다. 예를 들어, 인증된 적대적 방어 및 물리 기반 PDE 오차 보정과 같은 분야.
  • 희소성에 기반한 기법을 통해 쿼리 효율성과 모델 해석 가능성 유지와 함께, 일阶 방법에 가까운 정확도를 달성한다.

제안 방법

  • 랜덤 벡터 기반 추정(RGE) 대신 좌표 기반 기울기 추정(CGE)을 채택함으로써, 깊은 네트워크에서 분산을 감소시키고 수렴성을 향상시킨다.
  • 유한차분 기울기 추정 과정에서 깊이 있는 신경망의 내재된 희소성을 활용하는 희소성 유도 ZO 훈련 프로토콜을 도입한다.
  • 중복된 전방 전파를 줄이고 다중 파라미터에 걸친 ZO 훈련 속도를 향상시키기 위해 특징 재사용과 전방 병렬화를 구현한다.
  • 모델 쿼리에만 의존하는 계산 그래프 없는 훈련 파이프라인을 설계함으로써, 블랙박스 또는 자원 제약이 있는 환경에서의 구현을 가능하게 한다.
  • 아담 최적화기 내부에 ZO 최적화 프레임워크를 통합하여, 적응형 학습률과 안정적인 훈련 동역학을 구현한다.
  • 통합 손실 공식을 통해 감독 훈련(예: CIFAR-10)과 물리 기반 훈련(예: PDE 오차 보정)에 동일한 프레임워크를 적용한다.
Figure 1: Overview of our DeepZero framework. A: ZO gradient estimation via model queries (Sec. 3 ). B: Model pruning guides gradient sparsity (Sec. 4 ). C: Acceleration by parallelization and feature reuse (Sec. 5 ). D: DeepZero comparison with the computational graph free baseline Pattern Search (
Figure 1: Overview of our DeepZero framework. A: ZO gradient estimation via model queries (Sec. 3 ). B: Model pruning guides gradient sparsity (Sec. 4 ). C: Acceleration by parallelization and feature reuse (Sec. 5 ). D: DeepZero comparison with the computational graph free baseline Pattern Search (

실험 결과

연구 질문

  • RQ1좌표 기반 기울기 추정(CGE)이 깊은 ZO 최적화에서 랜덤 벡터 기반 추정(RGE)보다 훈련 정확도와 계산 효율성 측면에서 뛰어나다는가?
  • RQ2모델의 희소성을 어떻게 활용하여 고차원 DNN에서 ZO 훈련의 수렴성과 안정성을 향상시킬 수 있는가?
  • RQ3특징 재사용과 전방 병렬화가 대규모 DNN 훈련에서 ZO 최적화의 쿼리 비용을 얼마나 줄일 수 있는가?
  • RQ4ZO 최적화가 깊이 있는 모델을 처음부터 훈련할 때 일阶 방법과 비슷한 성능을 달성할 수 있는가?
  • RQ5제안된 ZO 프레임워크는 인증된 적대적 방어 및 PDE 오차 보정과 같은 실용적인 블랙박스 학습 작업에 효과적으로 적용될 수 있는가?

주요 결과

  • DeepZero는 ZO 최적화를 사용해 CIFAR-10에 대해 훈련된 ResNet-20에서 최신 기술 수준의 정확도를 달성하며, 일阶 훈련 방법의 성능에 근접한다.
  • 좌표 기반 기울기 추정(CGE)은 특히 더 깊은 네트워크에서 랜덤 벡터 기반 추정(RGE) 대비 훈련 정확도를 크게 향상시키고 계산 비용을 감소시킨다.
  • 희소성 유도 훈련 프로토콜은 유한차분 추정 과정에서 깊이 있는 모델의 내재된 희소성을 활용함으로써 안정적이고 효율적인 ZO 훈련을 가능하게 한다.
  • 특징 재사용과 전방 병렬화로 중복된 모델 쿼리가 줄어들어, 실용적 환경에서 ZO 훈련 속도가 최대 3.5배 향상된다.
  • DeepZero는 인증된 적대적 방어 및 물리 기반 PDE 오차 보정 작업에서 최신 기술 수준의 방법 대비 10–20% 향상된 성능을 기록한다.
  • 계산 그래프나 역전파 없이 종단 간 ZO 훈련이 가능하다는 점을 입증하며, 이는 블랙박스 및 온칩 학습 시나리오에서의 구현 가능성을 보여준다.
Figure A1: Illustration of the simple CNN considered with different depths.
Figure A1: Illustration of the simple CNN considered with different depths.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.