Skip to main content
QUICK REVIEW

[논문 리뷰] Data Leakage in Federated Averaging

Dimitar I. Dimitrov, Mislav Balunović|arXiv (Cornell University)|2022. 06. 24.
Privacy-Preserving Technologies in Data인용 수 15
한 줄 요약

이 논문은 은폐된 중간 가중치, 다중 로컬 배치, 동시적인 레이블-파rameter 변화와 같은 과제를 극복하면서 연합 평균화(FedAvg)를 대상으로 하는 최적화 기반의 데이터 泄露 공격을 제안한다. 자동 미분을 활용한 시뮬레이션 기반 복원 손실과 에포크 순서에 영향을 받지 않는 사전 정보를 조합함으로써, 10개의 로컬 에포크와 에포크당 10개의 배치를 사용할 때 FEMNIST에서 45%의 이미지를 복원한다. 이는 기존의 FedSGD 공격보다 뚜렷하게 뛰어나다.

ABSTRACT

Recent attacks have shown that user data can be recovered from FedSGD updates, thus breaking privacy. However, these attacks are of limited practical relevance as federated learning typically uses the FedAvg algorithm. Compared to FedSGD, recovering data from FedAvg updates is much harder as: (i) the updates are computed at unobserved intermediate network weights, (ii) a large number of batches are used, and (iii) labels and network weights vary simultaneously across client steps. In this work, we propose a new optimization-based attack which successfully attacks FedAvg by addressing the above challenges. First, we solve the optimization problem using automatic differentiation that forces a simulation of the client's update that generates the unobserved parameters for the recovered labels and inputs to match the received client update. Second, we address the large number of batches by relating images from different epochs with a permutation invariant prior. Third, we recover the labels by estimating the parameters of existing FedSGD attacks at every FedAvg step. On the popular FEMNIST dataset, we demonstrate that on average we successfully recover >45% of the client's images from realistic FedAvg updates computed on 10 local epochs of 10 batches each with 5 images, compared to only <10% using the baseline. Our findings show many real-world federated learning implementations based on FedAvg are vulnerable.

연구 동기 및 목표

  • FedAvg 업데이트로부터 클라이언트 데이터를 복원하는 데 있어 주요 과제를 특정하고 해결하는 것—이는 중간 가중치 변화와 배치 다양성으로 인해 FedSGD보다 더 복잡하기 때문이다.
  • 다중 로컬 에포크와 배치를 포함한 현실적인 FedAvg 설정에서 작동하는 실용적인 데이터 泄露 공격을 개발하는 것.
  • 레이블 수 추정과 에포크 간 배치 순서에 영향을 받지 않는 구조적 사전 정보를 활용하여 복원 정확도를 향상시키는 것.
  • 실제 시스템에서 널리 사용되는 FedAvg가 프라이버시 보호 설계를 갖추고 있음에도 불구하고 데이터 복원 공격에 취약하다는 것을 입증하는 것.

제안 방법

  • 공격는 자동 미분을 사용하여 클라이언트의 로컬 학습 과정을 시뮬레이션하고, 가짜 입력과 레이블을 최적화하여 최종 모델 가중치를 일치시킨다.
  • 로컬 업데이트 중 변화하는 모델 가중치를 고려한 시뮬레이션 기반 복원 손실($\mathcal{L}_{\text{sim}}$)을 도입한다.
  • 에포크 순서에 영향을 받지 않는 사전 정보($\mathcal{L}_{\text{inv}}$)는 순서에 영향을 받지 않는 함수 $g$ (예: 평균 또는 최대값)를 사용하여 이미지 시퀀스를 압축하고, 서로 다른 에포크 간에 비교함으로써 배치 복잡도를 줄인다.
  • FedSGD 기반 확장 방식을 활용해 레이블 수($\widetilde{\lambda}^c$)를 추정함으로써 복원 과정에 정보를 제공하고 정확도를 향상시킨다.
  • $\mathcal{L}_{\text{sim}}$와 $\mathcal{L}_{\text{inv}}$를 학습 가능한 가중치 $\lambda_{\text{inv}}$를 통해 조합하여 복원 정밀도와 구조적 일관성 간의 균형을 이룬다.
  • FEMNIST의 경우 $g = \text{mean}$ 및 $D_{\text{inv}} = \ell_2$를 사용하고, CIFAR100의 경우 $g = \text{conv}+\max$이며 $D_{\text{inv}} = \ell_2$를 사용하여 기능 수준의 순서에 영향을 받지 않는 성질을 향상시킨다.

실험 결과

연구 질문

  • RQ1중간 모델 가중치가 없고 다중 로컬 배치가 존재하는 상황에서 FedAvg 업데이트로부터 데이터를 효과적으로 복원할 수 있는가?
  • RQ2배치 순서가 알려져 있지 않고 에포크 간으로 변할 때, 에포크 순서에 영향을 받지 않는 사전 정보는 복원 성능을 어떻게 향상시키는가?
  • RQ3시뮬레이션 기반 손실과 구조적 사전 정보를 조합했을 때, FedSGD 기반 공격에 비해 FedAvg에서 성능이 얼마나 뛰어나지는가?
  • RQ4레이블 수 추정과 기능 수준의 사전 정보는 복잡한 데이터셋인 CIFAR100의 복원 품질 향상에 어떤 역할을 하는가?
  • RQ5순서에 영향을 받지 않는 함수와 거리 측정법의 선택이 최종 복원 성능에 어떤 영향을 미치는가?

주요 결과

  • 제안된 공격는 현실적인 FedAvg 설정(10개의 로컬 에포크, 에포크당 10개의 배치, 배치당 5개의 이미지)을 사용할 때 FEMNIST 데이터셋에서 클라이언트 이미지의 45%를 성공적으로 복원한다. 이는 기존 FedSGD 공격의 10% 미만에 비해 뚜렷하게 뛰어나다.
  • 에포크 순서에 영향을 받지 않는 사전 정보의 사용은 복원 품질을 크게 향상시키며, 특히 CIFAR100에서는 랜덤 컨볼루션과 최대 풀링의 조합이 가장 우수한 성능을 낸다.
  • ℓ₂ 거리와 평균 함수는 ℓ₁ 및 최대값 함수보다 일관되게 우수하며, ℓ₂는 다양한 데이터셋에 걸쳐 더 우수한 일반화 성능을 보인다.
  • FEMNIST에서는 컨볼루션 특징의 추가가 성능 향상에 기여하지 않아, 간단한 사전 정보로도 간단한 데이터셋에서는 충분하다는 것을 시사한다.
  • CIFAR100에서는 $\text{conv}+\max$ 사전 정보가 $\text{mean}$에 비해 복원 정확도를 2.8%p 향상시켜, 복잡한 특징 추출 기법이 복잡한 데이터에서 성능 향상에 기여한다는 것을 보여준다.
  • 절단 분석 결과, 시뮬레이션 손실과 순서에 영향을 받지 않는 사전 정보 모두가 복원 성공에 기여하며, 특히 배치 순서의 모호성을 완화하는 데 있어 후자가 특히 효과적임을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.