[논문 리뷰] Renyi Differential Privacy of the Subsampled Shuffle Model in Distributed Learning
이 논문은 분산 학습의 서브샘플드 셰플 모델에서 Renyi 차별적 프라이버시(RDP)를 위한 새로운 분석 프레임워크를 제안하며, 국소 랜덤화 메커니즘에 대해 더 날카운 프라이버시 경계를 가능하게 한다. 서브샘플링과 셰플링을 고려한 명시적 RDP 경계를 유도함으로써, 이전의 약한 DP 접근 방식에 비해 구성 시 더 강력한 프라이버시 보장을 달성한다. 실제 데이터셋에서의 성능 향상이 입증되었다.
We study privacy in a distributed learning framework, where clients collaboratively build a learning model iteratively through interactions with a server from whom we need privacy. Motivated by stochastic optimization and the federated learning (FL) paradigm, we focus on the case where a small fraction of data samples are randomly sub-sampled in each round to participate in the learning process, which also enables privacy amplification. To obtain even stronger local privacy guarantees, we study this in the shuffle privacy model, where each client randomizes its response using a local differentially private (LDP) mechanism and the server only receives a random permutation (shuffle) of the clients' responses without their association to each client. The principal result of this paper is a privacy-optimization performance trade-off for discrete randomization mechanisms in this sub-sampled shuffle privacy model. This is enabled through a new theoretical technique to analyze the Renyi Differential Privacy (RDP) of the sub-sampled shuffle model. We numerically demonstrate that, for important regimes, with composition our bound yields significant improvement in privacy guarantee over the state-of-the-art approximate Differential Privacy (DP) guarantee (with strong composition) for sub-sampled shuffled models. We also demonstrate numerically significant improvement in privacy-learning performance operating point using real data sets.
연구 동기 및 목표
- 클라이언트들이 로컬 데이터를 보호하면서 공동으로 모델을 훈련하는 분산 학습에서의 프라이버시-유용성 트레이드오프를 해결하기 위해.
- Renyi 차별적 프라이버시(RDP)를 사용하여 서브샘플드 셰플 모델에 대한 엄밀한 프라이버시 분석을 개발하여, 약한 DP에 비해 더 날카운 구성 경계를 가능하게 하기 위해.
- 서브샘플드 셰플 설정에서 어떤 이산 국소 차별적 프라이버시(LDP) 메커니즘에도 적용 가능한 명시적이고 수치적으로 다룰 수 있는 RDP 경계를 유도하기 위해.
- 제안된 RDP 분석이 기존 방법에 비해 특히 강한 구성 조건 하에서 프라이버시-유용성 성능에 측정 가능한 향상을 이끌어내는지 확인하기 위해.
- 스토하스틱 그래디언트 디센트(SGD)의 프라이버시-수렴 트레이드오프를 설정하여, 프라이버시 보장을 수렴 속도에 연결하기 위해.
제안 방법
- 저자는 서브샘플드 셰플 메커니즘의 RDP 분석을 셰플 메커니즘에 대한 삼항 |χ|^α-DP로 줄이는 새로운 이론적 기법을 도입하여 계산 가능성을 확보한다.
- RDP 순서 λ, 서브샘플링 비율 γ, LDP 파라미터 ε₀, 클라이언트 수 n에 대한 함수로, 임의의 이산 ε₀-LDP 메커니즘에 대한 명시적 상한 경계를 도출한다.
- 이 방법은 각 클라이언트가 LDP 메커니즘을 적용하고 서버가 오직 메시지의 무작위 순열만 수신하는 셰플 모델의 구조를 활용하여, 셰플링을 통한 프라이버시 약화를 가능하게 한다.
- 이웃 데이터셋 하에서 이항형 랜덤 변수의 분산 계산을 사용하여, 상한 경계의 날카움을 검증하기 위해 RDP 하한 경계도 확립한다.
- RDP 구성 정리들을 사용해 다중 반복에 걸친 프라이버시 분석을 수행한 후, 실용적 해석을 위해 약한 DP로 변환한다.
- 볼록성 및 리프시츠 연속성 가정 하에서 수렴 분석을 수행하여, 유한한 기울기 분산이 스토하스틱 그래디언트 디센트의 수렴 속도에 연결됨을 밝힌다.
실험 결과
연구 질문
- RQ1임의의 이산 국소 랜덤화 메커니즘을 갖는 서브샘플드 셰플 모델에 대해 Renyi 차별적 프라이버시(RDP)를 어떻게 날카운 경계로 제한할 수 있는가?
- RQ2RDP 구성을 사용할 경우 서브샘플드 셰플 모델에서의 프라이버시-유용성 트레이드오프는 어떻게 되며, 약한 DP 경계와 비교해 볼 때 어떠한가?
- RQ3제안된 RDP 분석은 특히 강한 구성 조건 하에서 기존 방법에 비해 상당히 더 나은 프라이버시 보장을 제공할 수 있는가?
- RQ4실제 적용 환경에서 서브샘플링 비율, 클라이언트 수, LDP 파라미터 ε₀에 따라 프라이버시 경계는 어떻게 스케일링되는가?
- RQ5서브샘플드 셰플 모델에서 유도된 프라이버시 제약 조건 하에서 스토하스틱 그래디언트 디센트의 수렴 속도는 어떻게 되는가?
주요 결과
- 제안된 RDP 경계는 명시적이며 수치적으로 계산 가능하며, 이전의 약한 DP 경계가 제한되는 영역을 포함한 모든 파라미터 영역에 대해 유효하다.
- 수치적 결과는 강한 구성 조건 하에서 RDP 기반 프라이버시 보장이 최신의 약한 DP 경계보다 상당히 향상되었음을 보여주며, 특히 낮은 프라이버시 영역에서 두드러진다.
- 실제 데이터셋에서의 성능 향상이 입증되어, 이론적 경계를 넘어서 실용적 관련성을 입증한다.
- 이론적 상한 경계가 날카로움을 입증하기 위해, 이웃 데이터셋 하에서 이항형 변수의 분산 분석을 통해 일치하는 하한 경계가 확립되었다.
- 프라이버시-수렴 트레이드오프 분석은 알고리즘이 O(DG log(T)/√T)의 수렴 속도를 달성함을 확인하였으며, 여기서 G는 기울기 분산과 서브샘플링 비율에 따라 달라진다.
- 분석은 서브샘플링과 셰플링에 의한 프라이버시 약화가 서로 곱셈적으로 조합되어, 각각의 메커니즘이 독립적으로 작용할 때보다 더 강력한 종합적 프라이버시 보장을 제공함을 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.