Skip to main content
QUICK REVIEW

[논문 리뷰] Differentially private cross-silo federated learning

Mikko Heikkilä, Antti Koskela|arXiv (Cornell University)|2020. 07. 10.
Privacy-Preserving Technologies in Data참고 문헌 40인용 수 22
한 줄 요약

이 논문은 암호화된 합산과 분산 서브샘플링을 사용하여 복잡한 모델(예: 딥 뉴럴 네트워크)을 훈련시키면서 강력한 프라이버시 보장을 보장하는 차별적 비공식적인 크로스실 페더레이티드 러닝을 제안한다. 최적화된 암호 프로토콜과 무작위 투영을 통해 통신 효율성을 높여, 비분산 환경과 유사한 정확도를 유지하면서도 확장성 있는 런타임을 달성한다.

ABSTRACT

Strict privacy is of paramount importance in distributed machine learning. Federated learning, with the main idea of communicating only what is needed for learning, has been recently introduced as a general approach for distributed learning to enhance learning and improve security. However, federated learning by itself does not guarantee any privacy for data subjects. To quantify and control how much privacy is compromised in the worst-case, we can use differential privacy. In this paper we combine additively homomorphic secure summation protocols with differential privacy in the so-called cross-silo federated learning setting. The goal is to learn complex models like neural networks while guaranteeing strict privacy for the individual data subjects. We demonstrate that our proposed solutions give prediction accuracy that is comparable to the non-distributed setting, and are fast enough to enable learning models with millions of parameters in a reasonable time. To enable learning under strict privacy guarantees that need privacy amplification by subsampling, we present a general algorithm for oblivious distributed subsampling. However, we also argue that when malicious parties are present, a simple approach using distributed Poisson subsampling gives better privacy. Finally, we show that by leveraging random projections we can further scale-up our approach to larger models while suffering only a modest performance loss.

연구 동기 및 목표

  • 강력한 차별적 비공식성 보장을 보장하면서 크로스실 페더레이티드 러닝 환경에서 복잡한 머신러닝 모델의 프라이버시 보장 훈련을 가능하게 하기 위해.
  • 데이터 기원이 익명인 분산 환경에서 서브샘플링에 의한 프라이버시 강화를 달성하는 데 도전하는 문제를 해결하기 위해.
  • 안전한 다자간 암호 계산과 무작위 투영을 통해 차별적 비공식성 페더레이티드 러닝의 계산 및 통신 오버헤드를 줄이기 위해.
  • 신뢰할 수 있는 실행 환경(TEEs)을 사용한 대규모 분산 학습에서 프라이버시, 정확도, 효율성 간의 트레이드오프를 평가하기 위해.
  • 수백만 개의 파라미터를 가진 모델에 대해서도 실용적이고 확장 가능하며 정확한 DP-FL이 가능함을 입증하기 위해.

제안 방법

  • 추가적으로 호모모르픽인 암호화된 다자간 계산(SMC)과 차별적 비공식성을 결합하여 크로스실 FL에서 모델 업데이트의 안전한 집계를 가능하게 한다.
  • 임의의 샘플링 체계(예: 복원이 없는 샘플링 및 포아송 샘플링 포함)를 지원하는 새로운 무관심 분산 서브샘플링 알고리즘을 도입한다.
  • 악성 당사자가 존재할 경우 복잡한 복원이 없는 샘플링보다 더 강건한 대안으로 분산 포아송 샘플링을 활용한다.
  • 무작위 투영을 활용하여 모델 기울기를 저차원 임베딩으로 압축하여 통신 및 암호화 비용을 줄인다.
  • 측정 가능한 측면 공격 및 메모리 접근 유출로부터 보호하기 위해 신뢰할 수 있는 실행 환경(TEEs)을 추가 보안 계층으로 활용한다.
  • 각 업데이트당 프라이버시 예산을 줄이기 위해 서브샘플링에 의한 프라이버시 강화를 적용하여 전체적인 DP 보장을 향상시킨다.

실험 결과

연구 질문

  • RQ1강력한 프라이버시 보장을 보장하면서도 크로스실 환경에서 대규모 모델에 대해 차별적 비공식성 페더레이티드 러닝을 효율적으로 확장할 수 있는가?
  • RQ2악성 당사자가 존재할 경우 포아송 샘플링과 복원이 없는 샘플링 간의 선택이 프라이버시에 어떤 영향을 미치는가?
  • RQ3무작위 투영을 통해 DP-FL에서 통신 및 계산 오버헤드를 줄이면서도 모델 유틸리티를 어느 정도 유지할 수 있는가?
  • RQ4안전한 다자간 계산과 분산 서브샘플링을 사용할 경우, 프라이버시, 정확도, 런타임 간의 트레이드오프는 어떠한가?
  • RQ5제안된 방법이 실질적으로 비분산 DP 훈련과 유사한 성능을 달성할 수 있는가?

주요 결과

  • 제안된 DP-SMC 방법은 분산된 노이즈 생성 조건에서도 신뢰할 수 있는 중앙 집계자와 구별할 수 없는 예측 정확도를 달성한다.
  • 8개의 컴퓨팅 노드를 사용할 경우 총 런타임을 최대 10배까지 줄일 수 있으며 정확도에 미미한 영향을 미쳐 약 100만 개의 파라미터를 가진 모델의 확장 가능한 훈련을 가능하게 한다.
  • 악성 당사자가 존재할 경우 분산 포아송 샘플링은 복잡한 복원이 없는 샘플링보다 더 우수한 프라이버시 보장을 제공한다.
  • 차원 수가 k=100인 무작위 투영은 암호화된 통신량을 1000배까지 줄여도 테스트 정확도를 전체 모델과 1-2% 이내로 유지한다.
  • 시스템은 최대 약 9×10^5개의 파라미터를 가진 모델로 확장 가능하며, (1.7, 10^-5)-DP 보장을 달성하면서도 합리적인 정확도 손실과 런타임을 유지한다.
  • SMC와 서브샘플링을 포함한 전체 시스템은 엄격한 프라이버시 조건 하에서 딥 뉴럴 네트워크의 실용적이고 효율적인 훈련을 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.