[논문 리뷰] Fast and Memory Efficient Differentially Private-SGD via JL Projections
이 논문은 페르소널라이제이션된 기울기 노름을 근사하기 위해 존슨-린든스트라우스(JL) 투영을 사용하는 차별적(private) 최적화 방법인 DP-SGD-JL과 DP-Adam-JL을 제안한다. 이는 메모리와 계산 비용을 크게 줄이며도 개인정보 보호를 유지한다. 방법은 비공개 SGD와 유사한 학습 속도와 메모리 사용량을 달성하며, f-DP 프레임워크를 통해 개인정보 보호 보장을 받는다. IMDb LSTM 벤치마크에서 정밀도-개인정보 보호 트레이드오프를 희생시키지 않고도 뚜렷한 속도 향상을 보였다.
Differentially Private-SGD (DP-SGD) of Abadi et al. (2016) and its variations are the only known algorithms for private training of large scale neural networks. This algorithm requires computation of per-sample gradients norms which is extremely slow and memory intensive in practice. In this paper, we present a new framework to design differentially private optimizers called DP-SGD-JL and DP-Adam-JL. Our approach uses Johnson-Lindenstrauss (JL) projections to quickly approximate the per-sample gradient norms without exactly computing them, thus making the training time and memory requirements of our optimizers closer to that of their non-DP versions. Unlike previous attempts to make DP-SGD faster which work only on a subset of network architectures or use compiler techniques, we propose an algorithmic solution which works for any network in a black-box manner which is the main contribution of this paper. To illustrate this, on IMDb dataset, we train a Recurrent Neural Network (RNN) to achieve good privacy-vs-accuracy tradeoff, while being significantly faster than DP-SGD and with a similar memory footprint as non-private SGD. The privacy analysis of our algorithms is more involved than DP-SGD, we use the recently proposed f-DP framework of Dong et al. (2019) to prove privacy.
연구 동기 및 목표
- 표준 DP-SGD에서의 개별 샘플 기울기 노름 계산으로 인한 높은 계산 및 메모리 오버헤드 문제를 해결하기 위해, 이는 대규모 딥러닝에서의 실용적 사용을 제한한다.
- 컴파일러 최적화나 아키텍처 특화 수정에 의존하지 않고, 차별적(private) 학습을 가속화하는 알고리즘적 솔루션을 설계하기 위해.
- f-DP 프레임워크를 사용해 강력한 개인정보 보호 보장을 유지하면서도, 속도와 메모리 사용량 측면에서 비공개 SGD에 가까운 성능을 달성하기 위해.
- IMDb와 같은 개인 정보가 포함된 데이터셋에서 RNN과 같은 복잡한 모델의 하이퍼파rameter 검색 및 학습을 효율적으로 가능하게 하기 위해.
제안 방법
- 정확한 계산을 피하기 위해, 개별 샘플 기울기 ℓ₂ 노름을 확률적으로 추정하기 위해 존슨-린든스트라우스(JL) 투영을 사용한다.
- 기울기의 무작위 부분공간에 JL 투영을 적용하여, 통제 가능한 오차로 기울기 노름을 신속하게 근사한다.
- 정확한 개별 샘플 기울기 노름 계산을 대체하기 위해, JL 기반의 노름 추정을 DP-SGD 및 DP-Adam 프레임워크에 통합한다.
- Dong 등(2019)의 f-DP 프레임워크를 사용해, JL 투영으로 인한 오차를 고려한 공식적 개인정보 보호 분석을 수행한다.
- 적응형 복합 및 샘플링 기법을 사용하여, f-DP 프레임워크 하에서 종단 간 개인정보 보호 경계를 유도한다.
- 복합 정리 하에서 가능한 한 날카로운 개인정보 보호 곡선을 계산하기 위해 이중 콘作弊**(double convex conjugate)를 사용한다.
실험 결과
연구 질문
- RQ1JL 투영을 사용해 DP-SGD에서 개별 샘플 기울기 노름을 근사할 수 있는가? 이로 인해 개인정보 보호나 정확도에 미치는 영향은 최소한인가?
- RQ2제안된 DP-SGD-JL 방법은 비공개 SGD와 유사한 학습 속도와 메모리 사용량을 달성하면서도 강력한 개인정보 보호 보장을 유지하는가?
- RQ3JL 차원의 선택이 결과 모델의 개인정보 보호-정확도 트레이드오프에 어떻게 영향을 미치는가?
- RQ4JL 투영으로 인한 무작위 노름 추정을 사용하는 차별적(private) 최적화 방법의 개인정보 분석에 f-DP 프레임워크를 효과적으로 적용할 수 있는가?
- RQ5DP-SGD-JL은 개인 정보가 포함된 데이터셋에서 RNN과 같은 복잡한 모델의 하이퍼파rameter 검색 및 학습에 적합한가?
주요 결과
- IMDb 데이터셋에서 DP-SGD-JL은 표준 DP-SGD보다 LSTM 모델을 훨씬 더 빠르게 학습시키며, 비공개 SGD와 거의 동일한 메모리 사용량을 유지한다.
- 개인정보 파라미터 ε는 JL 차원이 증가함에 따라 단조롭게 감소하며, JL 차원이 증가함에 따라 순수한 DP-SGD의 ε로 수렴한다.
- IMDb RNN 벤치마크에서 DP-SGD-JL은 표준 DP-SGD보다 학습 효율성이 뛰어나며, 유리한 개인정보 보호-정확도 트레이드오프를 달성한다.
- f-DP를 통한 이론적 개인정보 보호 분석 결과, JL 투영으로 인한 오차는 유한하며 전체 개인정보 보장 보장을 손상시키지 않는다.
- 이 알고리즘은 아키텍처에 종속되지 않으며, 다양한 신경망 유형에서 DP-SGD의 블랙박스 대체로 작동한다.
- 수치적 평가 결과, f-DP와 JL 투영 오차를 기반으로 유도된 개인정보 보호 곡선이 단순 근사보다 더 날카로운 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.