Skip to main content
QUICK REVIEW

[논문 리뷰] Trading Off Privacy, Utility and Efficiency in Federated Learning

Xiaojin Zhang, Yan Kang|arXiv (Cornell University)|2022. 09. 01.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 수평적 및 수직적 FL을 통합하는 통합된 분산학습 프레임워크를 제안하며, 기밀성 泄露, 유틸리티 손실, 효율성 감소 사이의 본질적 트레이드오프를 정량화하는 No-Free-Lunch (NFL) 정리를 수립한다. 주요 기여는 이러한 세 가지 요소의 병합 비용에 대한 이론적 하한을 제시함으로써, 특정 시나리오에서는 단일 보호 메커니즘이 세 가지 차원에서 동시에 최적 성능을 달성할 수 없음을 증명하는 것이다.

ABSTRACT

Federated learning (FL) enables participating parties to collaboratively build a global model with boosted utility without disclosing private data information. Appropriate protection mechanisms have to be adopted to fulfill the opposing requirements in preserving extit{privacy} and maintaining high model extit{utility}. In addition, it is a mandate for a federated learning system to achieve high extit{efficiency} in order to enable large-scale model training and deployment. We propose a unified federated learning framework that reconciles horizontal and vertical federated learning. Based on this framework, we formulate and quantify the trade-offs between privacy leakage, utility loss, and efficiency reduction, which leads us to the No-Free-Lunch (NFL) theorem for the federated learning system. NFL indicates that it is unrealistic to expect an FL algorithm to simultaneously provide excellent privacy, utility, and efficiency in certain scenarios. We then analyze the lower bounds for the privacy leakage, utility loss and efficiency reduction for several widely-adopted protection mechanisms including extit{Randomization}, extit{Homomorphic Encryption}, extit{Secret Sharing} and extit{Compression}. Our analysis could serve as a guide for selecting protection parameters to meet particular requirements.

연구 동기 및 목표

  • 실제 제약 조건 하에서 분산학습 시스템에서 기밀성, 유틸리티, 효율성의 균형을 맞추는 데 있어 핵심 과제를 해결하기 위해.
  • 일관된 트레이드오프 분석을 위한 단일 이론적 프레임워크에서 수평적 및 수직적 분산학습을 통합하기 위해.
  • No-Free-Lunch (NFL) 정리를 사용하여 기밀성 泄露, 유틸리티 손실, 효율성 감소 간의 피할 수 없는 트레이드오프를 공식적으로 정량화하기 위해.
  • 랜덤화, 히든 암호화, 비밀공유, 압축과 같은 널리 사용되는 보호 메커니즘에 대해 기밀성 泄露, 유틸리티 손실, 효율성 감소의 하한을 유도하기 위해.
  • 시스템 설계를 위한 원칙적인 이론적 기반을 제공함으로써 실무자들이 최적의 보호 매개변수를 선택할 수 있도록 도와주기 위해.

제안 방법

  • 보호자-적대자 다이내믹스라는 공통 개념적 렌즈를 통해 수평적 (HFL) 및 수직적 (VFL) FL 설정을 모두 모델링하는 통합된 분산학습 프레임워크를 제안한다.
  • 세 가지 핵심 메트릭을 정의한다: 기밀성 泄露 (Jensen-Shannon 발산을 사용), 유틸리티 손실 (모델 성능 저하로 측정), 효율성 감소 (통신 및 계산 오버헤드로 측정).
  • 기본 문제에 따라 정의되는 양수 상수를 초과하는 기밀성 泄露, 유틸리티 손실, 효율성 감소의 가중합을 포함하는 No-Free-Lunch (NFL) 정리를 수립한다. 이는 어떤 메커니즘도 동시에 세 가지 요소를 최적화할 수 없음을 증명한다.
  • 확률론적 및 정보이론적 도구(예: KL 발산, 곱분포 포함)를 사용하여 NFL 정리를 적용하여 각 보호 메커니즘에 대한 분석적 하한을 도출한다.
  • 대칭적이고 삼각부등식을 만족하는 기밀성 측정을 가능하게 하여 더 강력한 이론적 분석과 안정성을 확보하기 위해, KL 발산의 대체로 JS 발산을 사용한다.
  • 모델 왜곡 파라미터와 압축 확률에 기반하여, 랜덤화, Paillier 히든 암호화, 비밀공유, 압축 메커니즘 하에서 기밀성 泄露, 유틸리티 손실, 효율성 감소에 대해 닫힌 형태의 하한을 도출한다.
Figure 1: Illustration of the HFL procedure (left) and VFL procedure (right). For the HFL setting, we consider the server as the adversary who aims to infer individual clients’ private data. For the VFL setting, we consider client 1 (has no labels) as the adversary who wants to recover the labels ow
Figure 1: Illustration of the HFL procedure (left) and VFL procedure (right). For the HFL setting, we consider the server as the adversary who aims to infer individual clients’ private data. For the VFL setting, we consider client 1 (has no labels) as the adversary who wants to recover the labels ow

실험 결과

연구 질문

  • RQ1분산학습 시스템이 동시에 최소 기밀성 泄露, 최소 유틸리티 손실, 최소 효율성 감소를 달성할 수 있는가?
  • RQ2분산학습에서 기밀성, 유틸리티, 효율성 간의 기본 이론적 한계는 무엇인가?
  • RQ3랜덤화, 히든 암호화, 비밀공유, 압축과 같은 널리 사용되는 보호 메커니즘은 기밀성-유틸리티-효율성 트레이드오프 측면에서 어떻게 성능을 내는가?
  • RQ4각 보호 메커니즘 하에서 기밀성 泄露, 유틸리티 손실, 효율성 감소의 하한은 무엇인가?
  • RQ5NFL 정리는 수평적 및 수직적 분산학습 설정 전반에 걸쳐 균일하게 적용되어 시스템 내재 트레이드오프를 정량화할 수 있는가?

주요 결과

  • No-Free-Lunch (NFL) 정리는 분산학습에서 기밀성, 유틸리티, 효율성을 동시에 최적화하는 것이 불가능하다는 것을 증명한다. 정규화된 기밀성 泄露, 유틸리티 손실, 효율성 감소의 합은 비영이면서 문제에 따라 정의되는 양수 상수를 초과한다.
  • 랜덤화 메커니즘의 경우, 기밀성 泄露는 왜곡 파라미터의 함수로 하한이 정해지며, 유틸리티 손실은 0이고 효율성 감소는 노이즈 스케일에 따라 달라진다.
  • 비밀공유의 경우, 유틸리티 손실은 0이며, 기밀성 泄露는 왜곡 범위의 역수 비례 항으로 하한이 정해지므로, 더 강력한 기밀성을 확보하기 위해서는 더 큰 매개변수 공간 확장을 요구한다.
  • 압축의 경우, 기밀성 泄露, 유틸리티 손실, 효율성 감소 모두의 하한이 압축 확률의 곱을 포함하는 표현식으로 하한이 정해지며, 이는 높은 압축률이 기밀성 향상과 동시에 유틸리티 손실 증가를 초래함을 시사한다.
  • 각 메커니즘에 대해 도출된 하한은 실무에서 특정 시스템 요구사항을 충족시키기 위한 보호 매개변수 선택에 대한 이론적 안내를 제공한다.
  • KL 발산의 대체로 JS 발산을 사용함으로써 대칭적이며 삼각부등식을 만족하는 기밀성 측정이 가능해져, 트레이드오프 분석에서 이론적 취급 용이성과 강건성을 향상시켰다.
Figure 2: The unified federated learning framework (including HFL and VFL) illustrates the relationship between privacy leakage $\epsilon_{p}$ , utility loss $\epsilon_{u}$ , and efficiency reduction $\epsilon_{e}$ . $D$ denotes the private data, which can be either features or labels. $msg$ denotes
Figure 2: The unified federated learning framework (including HFL and VFL) illustrates the relationship between privacy leakage $\epsilon_{p}$ , utility loss $\epsilon_{u}$ , and efficiency reduction $\epsilon_{e}$ . $D$ denotes the private data, which can be either features or labels. $msg$ denotes

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.