Skip to main content
QUICK REVIEW

[논문 리뷰] Voting-based Approaches For Differentially Private Federated Learning

Yuqing Zhu, Xiang Yu|arXiv (Cornell University)|2020. 10. 09.
Privacy-Preserving Technologies in Data참고 문헌 40인용 수 6
한 줄 요약

이 논문은 차원에 따라 변하는 노이즈를 제거하고 통신 비용을 줄이기 위해 기울기 평균화 대신 레이블 기반 투표를 사용하는 두 가지 투표 기반의 차별적(private) 페더레이티드 러닝 방법, AE-DPFL과 kNN-DPFL을 제안한다. 이 방법은 특히 대규모 모델에서 뛰어난 프라이버시-유용성 트레이드오프를 달성하며, 투표 여백이 클 경우 보안 다자간 계산(secure multi-party computation)을 활용해 프라이버시를 지수적으로 증폭시킨다.

ABSTRACT

Differentially Private Federated Learning (DPFL) is an emerging field with many applications. Gradient averaging based DPFL methods require costly communication rounds and hardly work with large-capacity models, due to the explicit dimension dependence in its added noise. In this work, inspired by knowledge transfer non-federated privacy learning from Papernot et al.(2017; 2018), we design two new DPFL schemes, by voting among the data labels returned from each local model, instead of averaging the gradients, which avoids the dimension dependence and significantly reduces the communication cost. Theoretically, by applying secure multi-party computation, we could exponentially amplify the (data-dependent) privacy guarantees when the margin of the voting scores are large. Extensive experiments show that our approaches significantly improve the privacy-utility trade-off over the state-of-the-arts in DPFL.

연구 동기 및 목표

  • 차원에 따라 변하는 노이즈와 기울기 클리핑으로 인해 성능이 떨어지는 기울기 평균화 방법의 높은 통신 비용과 낮은 확장성 문제를 해결한다.
  • DP-FedAvg와 DP-FedSGD와 같은 기존 DPFL 방법의 한계를 극복한다. 이러한 방법들은 많은 통신 라운드를 요구하며, 모델 용량이 클수록 성능이 저하된다.
  • 공개된 비라벨 데이터를 활용해 프라이버시-유용성 트레이드오프를 향상시키는 지식 전이 모델에 기반한 새로운 DPFL 프레임워크를 설계한다.
  • 보안 다자간 계산과 투표 기반 집계를 사용해 에이전트 수준과 인스턴스 수준에서 증명 가능한 차별적 프라이버시 보장을 제공한다.
  • 레이블 투표가 기울기 클리핑과 노이즈 주입이 필요 없음을 입증함으로써, 데이터 분포 변화에 더 강건하고 더 나은 수렴 성능을 달성할 수 있음을 보여준다.

제안 방법

  • 기울기 집계를 비밀 레이블 투표로 대체: 각 로컬 모델이 공개된 비라벨 데이터에 대해 예측하고, 서버는 차별적 프라이버시를 보장하는 표절 계산(private ballot counting)을 통해 투표를 집계한다.
  • AE-DPFL에서는 공개된 데이터 레이블에 대해 다수의 로컬 모델이 투표하는 방식으로, 비밀 집계의 교사 앙상블(PATE) 프레임워크를 페더레이티드 러닝에 적응시켰다.
  • kNN-DPFL은 공개 데이터의 특징 임베딩에 기반한 k-가까운 이웃을 사용하며, 프라이버시를 확보하기 위해 투표 수에 노이즈를 추가한다.
  • 보안 다자간 계산(MPC)을 적용해 개별 기여를 드러내지 않고도 비밀 투표 수를 계산함으로써 강력한 프라이버시 증폭을 가능하게 한다.
  • 데이터 의존적 프라이버시 증폭을 활용: 레이블이 큰 여백으로 승리할 경우, MPC를 통해 프라이버시 보장이 지수적으로 향상된다.
  • 특징 추출을 위해 사전 훈련된 백본(예: ResNet50, AlexNet)을 사용하고, 클라이언트 데이터에서 로컬 모델을 훈련한 후 공개 데이터에 대해 레이블 투표를 수행한다.

실험 결과

연구 질문

  • RQ1레이블 기반 투표가 DPFL에서 기울기 평균화를 대체하여 통신 비용을 줄이고 차원에 따라 변하는 노이즈를 제거할 수 있는가?
  • RQ2투표 기반 DPFL이 DP-FedAvg와 DP-FedSGD와 같은 기울기 기반 DPFL 방법에 비해 더 나은 프라이버시-유용성 트레이드오프를 달성하는가?
  • RQ3투표 여백이 클 경우 보안 다자간 계산이 DPFL에서 프라이버시를 지수적으로 증폭시킬 수 있는가?
  • RQ4투표 기반 DPFL의 성능은 모델 용량과 데이터 분포 변화에 따라 어떻게 확장되는가?
  • RQ5강력한 공격자 조건 하에서도 에이전트 수준과 인스턴스 수준에서 강력한 프라이버시 보장을 유지하는가?

주요 결과

  • kNN-DPFL은 AlexNet에서 ResNet50로 전환할 때 유용성을 10% 향상시키지만, DP-FedSGD는 성능이 저하되어 대규모 모델에 대한 뛰어난 확장성 잠재력을 입증한다.
  • Office-Caltech 데이터셋에서, 동일한 프라이버시 예산 하에 kNN-DPFL은 DP-FedSGD보다 10% 이상 높은 정확도를 달성하거나, 동일한 정확도에서 프라이버시 비용을 60% 이상 감소시킨다.
  • DomainNet 데이터셋에서, 프라이버시 예산을 동일하게 설정했을 때 kNN-DPFL은 DP-FedSGD보다 정확도에서 10% 이상 높다.
  • AE-DPFL과 kNN-DPFL은 모든 설정에서 DP-FedAvg를 일관되게 능가하며, 특히 클라이언트당 데이터가 적을 경우 두드러진 성능 향상을 보인다.
  • 에이전트 수가 늘어남에 따라 DP-FedAvg 성능은 점점 감소하는 반면, kNN-DPFL은 800개의 에이전트가 있어도 명확한 우월성을 유지한다.
  • 에이전트당 로컬 데이터가 50개 미만일 경우, 둘 다 성능이 저하되며 이는 신뢰할 수 있는 레이블 집계를 위한 임계값이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.