[논문 리뷰] Practical and Private (Deep) Learning without Sampling or Shuffling
이 논문은 샘플링 또는 셔플링에 의한 프라이버시 강화에 의존하지 않고도 경쟁적인 프라이버시-정확도 트레이드오프를 달성하는 차별적 프라이버시 온라인 학습 알고리즘인 DP-FTRL을 제안한다. 트리 집계를 통해 관련된 노이즈를 사용함으로써 FTRL 프레임워크 내에서, DP-FTRL은 다양한 데이터 접근 패턴을 유연하게 처리할 수 있으며, 여러 벤치마크에서 샘플링 또는 셔플링 없이도 DP-SGD보다 뛰어난 성능을 보인다. 특히 고정확도, 저프라이버시 환경에서 두각을 나타낸다.
We consider training models with differential privacy (DP) using mini-batch gradients. The existing state-of-the-art, Differentially Private Stochastic Gradient Descent (DP-SGD), requires privacy amplification by sampling or shuffling to obtain the best privacy/accuracy/computation trade-offs. Unfortunately, the precise requirements on exact sampling and shuffling can be hard to obtain in important practical scenarios, particularly federated learning (FL). We design and analyze a DP variant of Follow-The-Regularized-Leader (DP-FTRL) that compares favorably (both theoretically and empirically) to amplified DP-SGD, while allowing for much more flexible data access patterns. DP-FTRL does not use any form of privacy amplification. The code is available at https://github.com/google-research/federated/tree/master/dp_ftrl and https://github.com/google-research/DP-FTRL .
연구 동기 및 목표
- 피어드 및 분산 학습 환경에서 샘플링 또는 셔플링에 의한 프라이버시 강화의 실용적 한계를 해결하기 위해.
- 균일한 무작위 미니배치 선택 또는 셔플링이 필요 없이 강력한 프라이버시 보장을 유지하는 차별적 프라이버시 최적화 알고리즘을 설계하기 위해.
- 프라이버시 강화 메커니즘에 의존하지 않고도 DP-SGD와 비교해 경쟁적 또는 슈퍼리어한 모델 정확도를 달성하기 위해.
- 데이터 접근 패턴이 비정규적 또는 클라이언트 가용성에 의해 제약을 받는 실세계 시스템에서의 실용적 구현을 가능하게 하기 위해.
제안 방법
- 누적 기울기의 관련된 노이즈를 트리 집계를 통해 추가함으로써, Follow-The-Regularized-Leader의 차별적 프라이버시 변형인 DP-FTRL을 제안한다.
- 시간 단계에 걸친 기울기 합의 노이즈 추가를 통해 차별적 프라이버시를 보장하기 위해 트리 집계를 사용한다. 이는 각 업데이트에 대한 노이즈가 아니라 시간에 따른 기울기 합에 노이즈를 추가함으로써 이루어진다.
- 독립적인 샘플링이나 셔플링이 필요 없이, 시간 단계 간의 관련된 노이즈에 의존함으로써 강력한 프라이버시 보장을 유지한다.
- 비독립적 또는 제한된 데이터 환경에서의 성능 향상을 위해 DP-FTRL 알고리즘에 리스타트 전략을 도입한다.
- 클라이언트 측의 무작위성 또는 参여 셔플링을 위한 조율이 필요 없도록, 노이즈 추가를 모델 업데이트에 직접 통합한다.
- 샘플링 없이도 전체 프라이버시 손실을 제한할 수 있도록 트리 집계 기법에 기반한 프라이버시 회계 방법을 사용한다.
실험 결과
연구 질문
- RQ1샘플링 또는 셔플링에 의한 프라이버시 강화에 의존하지 않고도, 강력한 프라이버시-정확도 트레이드오프를 달성할 수 있는 차별적 프라이버시 학습 알고리즘이 존재할 수 있는가?
- RQ2다양한 노이즈 수준과 데이터 접근 패턴에서 DP-FTRL과 DP-SGD의 정확도 및 프라이버시 보장 측면에서의 성능 비교는 어떠한가?
- RQ3피어드 학습 환경에서 균일한 샘플링 또는 셔플링이 필요 없어지는 것이 실용적으로 어떤 영향을 미치는가?
- RQ4DP-FTRL에서의 관련된 노이즈 추가가 DP-SGD의 독립적 노이즈보다 더 나은 프라이버시-유용성 트레이드오프를 제공할 수 있는가?
- RQ5실제 피어드 학습 구현에서, 보고 목표와 인구 규모가 DP-FTRL과 DP-SGD의 프라이버시 보장에 어떤 영향을 미치는가?
주요 결과
- DP-FTRL은 모든 프라이버시 수준에서 비강화된 DP-SGD를 크게 앞서며, 동일한 프라이버시 예산 하에서 더 높은 테스트 정확도를 달성한다.
- 고정확도, 저프라이버시 환경에서 DP-FTRL은 심지어 강화된 DP-SGD를 초월한다. 특히 StackOverflow 및 CIFAR-10 벤치마크에서 두각을 나타낸다.
- 목표 테스트 정확도 24.5%에서, DP-FTRL은 ε = 32.52 및 보고 목표 1000 조건에서 24.51%의 정확도를 달성했고, DP-SGD는 동일한 조건에서 25.19% 정확도를 달성하기 위해 ε = 7.71e4 가 필요했다.
- 보고 목표 1.03e4일 때, DP-FTRL은 ε = 3.56를 달성했고, DP-SGD는 ε = 8.11에 도달하기 위해 보고 목표 9.56e3 가 필요했다. 이는 DP-FTRL의 뛰어난 프라이버시 효율성을 보여준다.
- 보고 목표를 100에서 1000으로 증가시켰을 때, 두 알고리즘이나 유용성 면에서 향상되었지만, DP-FTRL은 훨씬 더 나은 프라이버시-유용성 트레이드오프를 유지했다. DP-FTRL은 ε = 32.52를 달성했고, DP-SGD는 ε = 7.71e4였다.
- DP-FTRL의 리스타트 전략은 엔도크 기반 학습 외부 환경에서 성능 향상을 이끌었으며, 라운드당 데이터가 제한된 환경에서 더 나은 수렴성과 프라이버시 회계를 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.