[논문 리뷰] A(DP)$^2$SGD: Asynchronous Decentralized Parallel Stochastic Gradient Descent with Differential Privacy
이 논문은 중앙 서버가 없는 분산 딥러닝 환경에서 프라이버시를 향상시키는 비밀유지 비동기 분산 확률적 경사 하강법 프레임워크인 A(DP)²SGD를 제안한다. 복합 고정밀 메커니즘에 레니 지식 차별적 프라이버시(Rényi differential privacy)를 적용하여, 최적의 O(1/√T) 수렴과 동기 프라이버시 SGD와 유사한 정확도를 달성하면서도 이질적인 환경에서 훨씬 빠른 학습 속도를 제공한다.
As deep learning models are usually massive and complex, distributed learning is essential for increasing training efficiency. Moreover, in many real-world application scenarios like healthcare, distributed learning can also keep the data local and protect privacy. A popular distributed learning strategy is federated learning, where there is a central server storing the global model and a set of local computing nodes updating the model parameters with their corresponding data. The updated model parameters will be processed and transmitted to the central server, which leads to heavy communication costs. Recently, asynchronous decentralized distributed learning has been proposed and demonstrated to be a more efficient and practical strategy where there is no central server, so that each computing node only communicates with its neighbors. Although no raw data will be transmitted across different local nodes, there is still a risk of information leak during the communication process for malicious participants to make attacks. In this paper, we present a differentially private version of asynchronous decentralized parallel SGD (ADPSGD) framework, or A(DP)$^2$SGD for short, which maintains communication efficiency of ADPSGD and prevents the inference from malicious participants. Specifically, R{é}nyi differential privacy is used to provide tighter privacy analysis for our composite Gaussian mechanisms while the convergence rate is consistent with the non-private version. Theoretical analysis shows A(DP)$^2$SGD also converges at the optimal $\mathcal{O}(1/\sqrt{T})$ rate as SGD. Empirically, A(DP)$^2$SGD achieves comparable model accuracy as the differentially private version of Synchronous SGD (SSGD) but runs much faster than SSGD in heterogeneous computing environments.
연구 동기 및 목표
- 중앙 서버가 존재하지 않는 비동기 분산 학습 환경에서의 프라이버시 泄露 위험을 해결하기 위해.
- 분산형, 이질적인 컴퓨팅 환경에서의 통신 효율성과 확장성을 유지하기 위해.
- 수렴 속도나 모델 정확도를 희생시키지 않고 강력한 프라이버시 보장을 제공하기 위해.
- 의료 분야와 같은 실생활 응용 분야에서 프라이버시 보장 분산 학습의 실용적 구현을 가능하게 하기 위해.
제안 방법
- 중앙 서버 없이 프라이버시를 보장하는 비동기 분산 확률적 경사 하강법(ADPSGD)의 비밀유지 변종인 A(DP)²SGD를 제안한다.
- 표준 (ε,δ)-DP보다 더 날카운 프라이버시 분석을 달성하기 위해 복합 고정밀 메커니즘에 레니 지식 차별적 프라이버시(RDP)를 적용한다.
- G-리프시츠 경사 하강의 민감도 한계와 배치 크기를 기반으로 계산된 고정밀 노이즈를 기울기 값에 주입한다.
- T회의 RDP 메커니즘의 순차적 복합을 통해 종단 간 프라이버시 예산 (ε,δ)를 유도한다.
- 노이즈 분산을 줄이고 프라이버시-유용성 트레이드오프를 향상시키기 위해 무작위로 선택하지 않은 표본 추출을 사용한다.
- RDP에서 (ε,δ)-DP로의 변환을 통해 프라이버시 파라미터를 유도하여, 이질적인 데이터 분포 상황에서도 공식적인 프라이버시 보장을 확보한다.
실험 결과
연구 질문
- RQ1비동기 분산 학습에 차별적 프라이버시를 효과적으로 통합할 수 있는가? 이는 수렴 속도나 통신 효율성을 떨어뜨리지 않는다.
- RQ2이질적인 환경에서 복합 고정밀 메커니즘에 레니 지식 차별적 프라이버시(RDP)를 적용하면 표준 (ε,δ)-DP보다 프라이버시 분석을 어떻게 향상시킬 수 있는가?
- RQ3비동기 업데이트 하에 제안된 비밀유지 분산 학습 기반 SGD의 수렴 속도는 어떻게 되는가?
- RQ4실제로 A(DP)²SGD의 모델 정확도는 비밀유지 동기 SGD(SSGD)와 비교해 어떻게 되는가?
- RQ5A(DP)²SGD는 동일한 프라이버시와 정확도를 유지하면서도 이질적인 컴퓨팅 환경에서 SSGD보다 더 빠른 학습을 달성할 수 있는가?
주요 결과
- A(DP)²SGD는 비밀유지 조건 하에서도 비공개 SGD와 동일한 최적의 O(1/√T) 수렴 속도를 달성한다.
- RDP 복합 및 변환을 통해 유도된 프라이버시 예산 ε를 기반으로 (ε,δ)-차별적 프라이버시를 제공하며, 공식적인 프라이버시 보장을 보장한다.
- 실험 결과 A(DP)²SGD는 CIFAR-10 및 SWB300 데이터셋에서 비밀유지 동기 SGD와 유사한 모델 정확도를 달성한다.
- 동기화 병목 현상이 없기 때문에 이질적 환경에서 SSGD보다 훨씬 더 빠른 실행 속도를 기록한다.
- 레니 지식 차별적 프라이버시의 사용은 더 날카운 프라이버시 분석을 가능하게 하여 낮은 노이즈 분산과 더 나은 유용성-프라이버시 트레이드오프를 달성한다.
- 다양한 설정에서 안정적인 성능을 보이며, 이질적인 데이터 분포와 다양한 워커 참여 상황에서도 강건함을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.