Skip to main content
QUICK REVIEW

[논문 리뷰] Differentially Private Optimization on Large Model at Small Cost

Zhiqi Bu, Yuxiang Wang|arXiv (Cornell University)|2022. 09. 30.
Stochastic Gradient Optimization Techniques인용 수 5
한 줄 요약

이 논문은 대규모 딥러닝 모델에서 차별적(private) 최적화의 계산 및 메모리 오버헤드를 극적으로 줄이는 새로운 시스템 수준 기법 Book-Keeping (BK)을 소개한다. 고스트 노름(Ghost Norm), 북키핑(Book-Keeping), 고스트 미분(Ghost Differentiation)을 조합함으로써 BK는 표준 학습 효율에 근접한 성능—시간 오버헤드 1.03배, 메모리 오버헤드 <1%—를 달성하면서도, 비전 및 언어 작업 전반에서 GPT2, ResNet, ViT에서 최신 수준의 DP 정확도를 유지한다.

ABSTRACT

Differentially private (DP) optimization is the standard paradigm to learn large neural networks that are accurate and privacy-preserving. The computational cost for DP deep learning, however, is notoriously heavy due to the per-sample gradient clipping. Existing DP implementations are 2-1000X more costly in time and space complexity than the standard (non-private) training. In this work, we develop a novel Book-Keeping (BK) technique that implements existing DP optimizers (thus achieving the same accuracy), with a substantial improvement on the computational cost. Specifically, BK enables DP training on large models and high dimensional data to be roughly as fast and memory-saving as the standard training, whereas previous DP algorithms can be inefficient or incapable of training due to memory error. The computational advantage of BK is supported by the complexity analysis as well as extensive experiments on vision and language tasks. Our implementation achieves state-of-the-art (SOTA) accuracy with very small extra cost: on GPT2 and at almost the same memory cost (&lt;1% overhead), BK has 1.03X the time complexity of the standard training (0.83X training speed in practice), and 0.61X the time complexity of the most efficient DP implementation (1.36X training speed in practice). We open-source the codebase for the BK algorithm at the FastDP library (https://github.com/awslabs/fast-differential-privacy).

연구 동기 및 목표

  • 대규모 모델과 고차원 데이터에 대해 차별적(private) 딥러닝의 높은 계산 및 메모리 비용을 해결한다.
  • 기존에 2–1000배의 속도 저하와 심각한 메모리 증가를 유발하는, DP 최적화기의 개별 샘플 기반 기울기 클리핑의 성능 저하 문제를 해결한다.
  • 시스템 수준 최적화를 통해 비밀유지 보장을 훼손하지 않으면서도 표준 비공개 학습에 근접한 효율성을 달성하는 DP 학습 기법을 설계한다.
  • LoRA, 어댑터 등 파라미터 효율적 파인튜닝과 분산 학습을 지원하도록 기법을 확장하여 광범위한 호환성을 확보한다.
  • 비전 및 언어 벤치마크에서 최신 수준의 프라이버시-정확도 트레이드오프를 달성하면서도 성능 오버헤드를 최소화한다.

제안 방법

  • 미니배치 내의 여러 샘플 간 중간 기울기 값을 추적하고 재사용하여, 개별 샘플 기반 기울기 노름을 효율적으로 계산하는 북키핑(BK) 기법을 도입한다.
  • 고스트 노름 기법을 활용해 개별 샘플 기울기를 명시적으로 저장하지 않음으로써 메모리 사용량을 감소시키고 기울기 노름 계산을 효율적으로 수행한다.
  • 고스트 미분을 적용하여 전체 개별 샘플 기울기를 저장하지 않고도 기울기를 계산함으로써 역전파 동안 메모리 프로파일을 최소화한다.
  • 모델 아키텍처와 특징 차원에 따라 고스트 노름과 개별 샘플 기울기 생성 간에 동적으로 전환하는 하이브리드 BK 알고리즘을 개발하여 성능을 최적화한다.
  • LoRA, BiTFit, ZeRO, 기울기 누적 등 다양한 PyTorch 모델, 최적화기, 학습 설정을 지원하는 모듈러하고 자동화된 코드베이스(FastDP)에 BK를 통합한다.
  • 이론적 복잡도 분석과 실증적 평가를 통해 BK가 이론적으로 이상적인 시간 및 공간 복잡도를 달성하고 실질적으로도 표준 학습에 근접한 성능을 보임을 검증한다.

실험 결과

연구 질문

  • RQ1DP 최적화에서 개별 샘플 기반 기울기 클리핑이 시간 및 메모리 복잡도 측면에서 표준 학습과 동일한 효율성을 달성할 수 있는가?
  • RQ2고스트 노름 및 북키핑과 같은 시스템 수준 최적화는 대규모 모델에서 DP 학습의 계산 부담을 어떻게 줄일 수 있는가?
  • RQ3다양한 모델 아키텍처와 입력 차원 간에 고스트 노름과 개별 샘플 기울기 생성 간의 최적의 트레이드오프는 무엇인가?
  • RQ4BK 기법은 프라이버시나 효율성을 희생시키지 않고도 파라미터 효율적 파인튜닝 및 분산 학습을 지원하도록 일반화될 수 있는가?
  • RQ5BK는 DP 학습에서 이론적 복잡도와 실질적인 하드웨어 성능 간 격차를 어느 정도 메울 수 있는가?

주요 결과

  • GPT2에서 BK는 표준 학습 대비 시간 복잡도를 1.03배로 줄여 실질적으로는 0.83배의 학습 속도를 달성하며, 메모리 오버헤드는 1% 미만이다.
  • RoBERTa-large에서 BK는 가장 효율적인 이전 DP 구현체인 GhostClip 대비 1.36배 빠른 속도를 기록했으며, 시간 복잡도는 0.61배로 감소했다.
  • BK는 BEiT-large 및 GPT2-large와 같은 대규모 모델을 단일 A100 GPU에서 메모리 오버플로우 없이 학습시킬 수 있었으며, 이는 이전 방법이 메모리 제약으로 실패했던 사례이다.
  • 하이브리드 BK 알고리즘은 트랜스포머에서는 고스트 노름을, 더 깊은 CNN에서는 개별 샘플 기울기 계산을 선호함으로써 아키텍처에 따라 적응적으로 전환하여 최적의 성능을 달성한다.
  • BK는 비전 및 언어 작업에서 최신 수준의 정확도를 유지한다: ε=3일 때 E2E에서 64.6 BLEU, ε=2일 때 CIFAR10에서 97.1% 정확도.
  • BK 기반으로 제작된 FastDP 라이브러리는 모든 모델, 최적화기, 학습 기법(예: LoRA, ZeRO)에 대해 자동 통합을 지원하여 광범위한 호환성과 미래 지향성을 확보한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.