[논문 리뷰] Subject Granular Differential Privacy in Federated Learning
이 논문은 피벗러닝에서 주체 수준의 차별적 프라이버시(DP)를 도입하며, 여기서 주체의 데이터는 여러 사용자에 걸쳐 분산되어 있다. 논문은 두 가지 새로운 알고리즘인 \localgroupdp 및 \higradavg를 제안하여 사용자 측에서 주체 수준의 DP를 국지적으로 구현한다. \localgroupdp는 FEMNIST 및 Shakespeare 데이터셋에서의 실험 평가에서 사용자 수준 및 항목 수준의 DP 기준선을 능가하는 최적의 프라이버시-모델 유틸리티 트레이드오프를 달성한다.
This paper considers subject level privacy in the FL setting, where a subject is an individual whose private information is embodied by several data items either confined within a single federation user or distributed across multiple federation users. We propose two new algorithms that enforce subject level DP at each federation user locally. Our first algorithm, called LocalGroupDP, is a straightforward application of group differential privacy in the popular DP-SGD algorithm. Our second algorithm is based on a novel idea of hierarchical gradient averaging (HiGradAvgDP) for subjects participating in a training mini-batch. We also show that user level Local Differential Privacy (LDP) naturally guarantees subject level DP. We observe the problem of horizontal composition of subject level privacy loss in FL - subject level privacy loss incurred at individual users composes across the federation. We formally prove the subject level DP guarantee for our algorithms, and also show their effect on model utility loss. Our empirical evaluation on FEMNIST and Shakespeare datasets shows that LocalGroupDP delivers the best performance among our algorithms. However, its model utility lags behind that of models trained using a DP-SGD based algorithm that provides a weaker item level privacy guarantee. Privacy loss amplification due to subject sampling fractions and horizontal composition remain key challenges for model utility.
연구 동기 및 목표
- 피벗러닝(FL)의 프라이버시 격차를 메우기 위해 주체의 데이터가 여러 사용자에 걸쳐 분산되어 있는 상황에서 주체 수준의 차별적 프라이버시를 도입한다.
- 항목 수준 및 사용자 수준의 프라이버시 보장과 구별되는 피벗러닝에서의 주체 수준 DP를 공식적으로 정의한다.
- 피벗레이션 사용자 측에서 주체 수준 DP를 구현하는 두 가지 새로운 알고리즘인 \\localgroupdp 및 \\higradavg를 개발하고 분석한다.
- 사용자 수준 로컬 차별적 프라이버시(LDP)가 자연스럽게 주체 수준 DP를 유도함을 보여주며, 비교를 위한 기준선을 제공한다.
- 주체 수준 DP 환경에서 수평적 조합에 의한 프라이버시 손실과 주체 데이터 분포가 모델 유틸리티에 미치는 영향을 조사한다.
제안 방법
- 각 사용자가 동일한 주체에 속하는 모든 데이터 항목의 그래디언트에 대해 DP를 적용하는 DP-SGD 프레임워크 내에서 그룹 차별적 프라이버시의 국지적 응용인 \\localgroupdp를 제안한다.
- 주체의 카디널리티에 따라 다중 수준에서 그래디언트를 평균화하는 히에라르키컬 그래디언트 평균화 기법인 \\higradavg를 도입하여 주체 수준 기여를 왜곡한다.
- 성질 정리와 조합 정리를 사용하여 볼록 손실 함수 하에서 \\localgroupdp 및 \\higradavg에 대한 주체 수준 DP 보장을 공식적으로 증명한다.
- 주체 샘플링 비율을 통한 프라이버시 강화를 통해 노이즈 스케일을 감소시키며, 각 미니배치 내 최대 주체 그룹 크기에 기반해 노이즈를 캘리브레이션한다.
- 표준 DP-SGD 노이즈 메커니즘(Gaussian 메커니즘)을 그래디언트에 적용하며, 프라이버시 예산을 각 데이터 항목이나 사용자 수준이 아닌 주체 그룹 수준에서 할당한다.
- 사용자 수준 LDP를 기준선으로 통합하여, 개인 사용자 기여가 왜곡됨으로써 자연스럽게 주체 수준 DP를 만족함을 보여준다.
실험 결과
연구 질문
- RQ1피벗러닝 환경에서 데이터가 여러 사용자에 걸쳐 분산되어 있을 경우, 주체 수준의 차별적 프라이버시를 어떻게 공식적으로 정의하고 보장할 수 있는가?
- RQ2주체 수준 DP 알고리즘과 기존의 항목 수준 또는 사용자 수준 DP 기준선 간의 성능 트레이드오프는 모델 유틸리티 측면에서 어떻게 나타나는가?
- RQ3피벗레이션 사용자 간 비균형적인 주체 데이터 분포가 주체 수준 DP 환경에서 프라이버시-유틸리티 트레이드오프에 어떤 영향을 미치는가?
- RQ4사용자 간 주체 수준 프라이버시 손실의 수평적 조합이 주체 수준 DP에서 모델 유틸리티에 어떤 영향을 미치는가?
- RQ5히에라르키컬 그래디언트 평균화 기법이 피벗러닝에서 노이즈 증폭을 효과적으로 줄이면서도 주체 수준 프라이버시를 유지하는 데 유용한가?
주요 결과
- \localgroupdp 알고리즘이 제안된 방법들 중에서 가장 높은 모델 유틸리티를 달성하며, 비공개 FedAvg 대비 FEMNIST에서 15%의 성능 저하와 Shakespeare에서 18%의 성능 저하를 보였다.
- 항목 수준 프라이버시 보장이 더 약한 것으로 간주되지만, LocalItemDP는 유틸리티 측면에서 \localgroupdp를 능가하며, FEMNIST에서 8%, Shakespeare에서 22%의 성능 저하로 나타났다.
- 사용자 수준 LDP는 \localgroupdp보다 유의미하게 높은 유틸리티 손실을 겪었으며, 더 높은 관측 손실과 낮은 테스트 정확도로 성능 저하가 명확하게 드러났다.
- \\higradavg는 특히 Shakespeare와 같이 주체의 카디널리티가 높은 데이터셋에서 노이즈 스케일이 최대 한 수준까지 증폭되어 \localgroupdp보다 성능이 열 劣하다.
- 비균형적인 주체 데이터 분포는 미니배치 내 그룹 크기를 증가시켜 프라이버시 예산을 감소시키며, 이는 \localgroupdp의 성능 저하를 유발한다. FEMNIST에서 α=16일 경우 테스트 정확도가 50% 이하로 떨어졌다.
- 주체 수준 프라이버시 손실의 수평적 조합은 학습 기간을 제한하고 모델 유틸리티를 추가로 떨어뜨리는 바, 실질적 구현에서의 주요 과제임을 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.