Skip to main content
QUICK REVIEW

[논문 리뷰] Distributed Adversarial Training to Robustify Deep Neural Networks at Scale

Gaoyuan Zhang, Songtao Lu|arXiv (Cornell University)|2022. 06. 13.
Adversarial Robustness in Machine Learning인용 수 5
한 줄 요약

이 논문은 다수의 머신을 통해 대규모 배치의 적대적 훈련을 스케일링할 수 있는 일반적이고 확장 가능한 프레임워크인 분산 적대적 훈련(DAT)을 제안한다. 비볼록 설정 하에서 $O(1/\sqrt{T})$ 속도로 제1차 정류점으로 수렴하며, ImageNet에서의 강건한 정확도를 유지하면서 기울기 압축과 준감독 훈련을 통해 효율적인 훈련을 가능하게 한다.

ABSTRACT

Current deep neural networks (DNNs) are vulnerable to adversarial attacks, where adversarial perturbations to the inputs can change or manipulate classification. To defend against such attacks, an effective and popular approach, known as adversarial training (AT), has been shown to mitigate the negative impact of adversarial attacks by virtue of a min-max robust training method. While effective, it remains unclear whether it can successfully be adapted to the distributed learning context. The power of distributed optimization over multiple machines enables us to scale up robust training over large models and datasets. Spurred by that, we propose distributed adversarial training (DAT), a large-batch adversarial training framework implemented over multiple machines. We show that DAT is general, which supports training over labeled and unlabeled data, multiple types of attack generation methods, and gradient compression operations favored for distributed optimization. Theoretically, we provide, under standard conditions in the optimization theory, the convergence rate of DAT to the first-order stationary points in general non-convex settings. Empirically, we demonstrate that DAT either matches or outperforms state-of-the-art robust accuracies and achieves a graceful training speedup (e.g., on ResNet-50 under ImageNet). Codes are available at https://github.com/dat-2022/dat.

연구 동기 및 목표

  • 높은 계산 비용과 데이터 크기로 인해 대규모 딥러닝에서 적대적 훈련(AT)의 확장성에 한계가 존재하는 문제를 해결한다.
  • 데이터 또는 계산 자원이 여러 머신에 분할된 분산 환경에서 효과적인 적대적 훈련을 가능하게 한다.
  • 분산 환경에서 감독, 준감독, 압축 기울기 변형의 AT를 모두 지원하는 일반적 프레임워크를 개발한다.
  • 기본적인 비볼록 최적화 조건 하에서 DAT의 수렴 보장을 이론적으로 확립한다.
  • 다양한 환경에서의 DAT의 강건성과 효율성을 실증적으로 검증한다: ImageNet, 무작위 스무딩, 미레이블 데이터, 다양한 하드웨어 구성

제안 방법

  • 대규모 배치 업데이트를 사용하여 여러 머신에 걸쳐 적대적 훈련을 확장하는 분산 최소-최대 최적화 프레임워크를 설계한다.
  • 통신 오버헤드를 줄이기 위해 기울기 압축과 적응형 학습률(예: LAMB 옵timizer)을 통합한다.
  • 통합 파ip라인에서 여러 공격 생성 방법(PGD, FGSM 등)과 데이터 유형(레이블 있음/없음)을 모두 지원하도록 알고리즘을 구성한다.
  • 기울기 추정, 양자화, 적응형 학습률, 내부 최대화 오라클에서 발생하는 내림값 오차를 이론적으로 분석한다.
  • 일반적인 비볼록 설정 하에서 제1차 정류점으로의 수렴 속도를 $O(1/\sqrt{T})$로 유도한다.
  • NCCL 통신 백엔드를 구현하고 InfiniBand 및 NVLink 인터커넥트를 사용한 HPC 클러스터 지원을 위한 프레임워크를 구현한다.

실험 결과

연구 질문

  • RQ1분산 컴퓨팅을 사용하여 대규모 배치 설정으로 적대적 훈련을 효과적으로 스케일링할 수 있는가, 강건성은 손상되지 않는가?
  • RQ2기울기 압축과 적응형 학습률과 같은 분산 최적화 구성 요소가 적대적 훈련의 수렴과 강건한 정확도에 어떤 영향을 미치는가?
  • RQ3비볼록, 확률적, 분산 설정 하에서 분산 적대적 훈련의 이론적 수렴 속도는 무엇인가?
  • RQ4제안된 프레임워크는 레이블 있음/없음 혼합 데이터 유형을 가진 대규모 데이터셋(예: ImageNet)에서 강건한 성능을 유지하는가?
  • RQ5표준 클러스터와 고성능 컴퓨팅(HPC) 시스템을 포함한 다양한 하드웨어 구성에서 이 프레임워크는 어떻게 성능을 발휘하는가?

주요 결과

  • DAT는 ResNet-50를 사용해 대규모 배치에서도 ImageNet에서 최신 기준 수준의 강건한 정확도를 달성하거나 초월한다.
  • 기존의 분산 AT에서 관찰되는 성능 저하 없이도 높은 표준 정확도를 유지하면서 강건성을 향상시킨다.
  • 이론적 분석을 통해 비볼록 설정에서 제1차 정류점으로의 수렴 속도가 $O(1/\sqrt{T})$임을 확인하였으며, 이는 표준 SGD와 동일한 속도이다.
  • 실증 결과로는 컴퓨팅 노드 수 증가(1, 3, 6개 노드 테스트)에 따라 훈련 시간이 유연하게 단축되며, 정확도 저하가 최소화됨을 보였다.
  • DAT는 준감독 강건한 훈련과 강건한 사전 훈련-피니팅을 지원하여 다양한 훈련 철학에 걸쳐 일반화 능력을 입증하였다.
  • InfiniBand 및 NVLink를 사용한 HPC 클러스터에서의 성능은 표준 분산 시스템 대비 통신 비용을 줄이고 확장성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.