Skip to main content
QUICK REVIEW

[논문 리뷰] A Novel Attribute Reconstruction Attack in Federated Learning

Lingjuan Lyu, Chen Chen|arXiv (Cornell University)|2021. 08. 16.
Privacy-Preserving Technologies in Data참고 문헌 15인용 수 13
한 줄 요약

이 논문은 페더레이티드 러닝에서 악성 서버가 소형 배치 그라디언트를 사용하는 기존 공격보다 더 현실적인, 에포크 평균 그라디언트에서 민감한 속성을 재구성하는 새로운 속성 재구성 공격(ARA)을 제안한다. 다양한 위협 모델(예: 알려지지 않은 사전 분포, 누락된 레이블 포함)에서 실세계 데이터셋을 대상으로 최신 기술 성능을 달성하는 cos-matching을 제안한다.

ABSTRACT

Federated learning (FL) emerged as a promising learning paradigm to enable a multitude of participants to construct a joint ML model without exposing their private training data. Existing FL designs have been shown to exhibit vulnerabilities which can be exploited by adversaries both within and outside of the system to compromise data privacy. However, most current works conduct attacks by leveraging gradients on a small batch of data, which is less practical in FL. In this work, we consider a more practical and interesting scenario in which participants share their epoch-averaged gradients (share gradients after at least 1 epoch of local training) rather than per-example or small batch-averaged gradients as in previous works. We perform the first systematic evaluation of attribute reconstruction attack (ARA) launched by the malicious server in the FL system, and empirically demonstrate that the shared epoch-averaged local model gradients can reveal sensitive attributes of local training data of any victim participant. To achieve this goal, we develop a more effective and efficient gradient matching based method called cos-matching to reconstruct the training data attributes. We evaluate our attacks on a variety of real-world datasets, scenarios, assumptions. Our experiments show that our proposed method achieves better attribute attack performance than most existing baselines.

연구 동기 및 목표

  • 페더레이티드 러닝에서 에포크 평균 그라디언트가 민감한 속성을 泄露할 수 있는지 확인하여 실용적인 위협 모델의 격차를 메운다.
  • 특히 전체 에포크 훈련이 적용되는 현실적인 FL 환경에서 기존 그라디언트 기반 공격보다 더 효율적이고 효과적인 방법을 개발한다.
  • 알려진/알 수 없는 사전 분포, 소속성, 진짜 레이블 등 다양한 적의 지식 수준에서 ARA를 체계적으로 평가한다.
  • 공격자가 전체 데이터나 레이블 정보를 확보하지 못하더라도 민감한 속성을 높은 정확도로 재구성할 수 있음을 입증한다.
  • 그라디언트 공유의 취약점을 드러내어 프라이버시 보장 페더레이티드 러닝 시스템 설계에 통찰을 제공한다.

제안 방법

  • 실제 그라디언트 업데이트와 가상 그라디언트 업데이트 간의 코사인 유사도를 사용하는 cos-matching을 제안하여 재구성을 이끌어내는 그라디언트 매칭 방법이다.
  • 가상 그라디언트와 진짜 그라디언트 간의 각도 거리 최소화를 위한 반복 최적화를 적용하여 정확한 속성 추론을 가능하게 한다.
  • 알려진/알 수 없는 사전 분포, 알려진/알 수 없는 소속성, 알려진/알 수 없는 진짜 레이블을 포함한 다양한 위협 모델을 지원한다.
  • 진짜 레이블이 알려지지 않았을 경우 가상 속성 및 레이블 최적화를 통합하여 종단 간 속성 복구를 가능하게 한다.
  • 실세계 데이터셋(예: Location, Purchase, Genome)을 사용하여 다양한 가정 하에서 성능를 평가한다.
  • 다중 라운드 그라디언트 관찰 전략을 적용하여 모델 업데이트의 시간적 일관성을 활용해 재구성 정밀도를 향상시킨다.

실험 결과

연구 질문

  • RQ1악성 서버가 소형 배치 그라디언트에 접근할 수 없더라도, 페더레이티드 러닝에서 에포크 평균 그라디언트로부터 민감한 속성을 재구성할 수 있는가?
  • RQ2적의 사전 지식 수준(예: 사전 분포, 소속성, 진짜 레이블)에 따라 속성 재구성 성능는 어떻게 변화하는가?
  • RQ3cos-matching은 현실적인 FL 환경에서 기존 그라디언트 기반 재구성 방법보다 더 효과적이고 효율적인가?
  • RQ4사전 분포가 알려지지 않았거나 레이블이 제공되지 않을 경우 공격 성능는 어떻게 저하되는가?
  • RQ5로컬 배치 크기와 데이터 분포는 속성 재구성 성공에 어떤 영향을 미치는가?

주요 결과

  • Location 데이터셋에서 사전 분포가 알려지지 않은 상황에서 B=|Dv|일 때 cos-matching은 첫 번째 속성에 대해 94.00%의 재구성 정확도를 달성했으며, 벤치마크를 능가했다.
  • Purchase100 데이터셋에서 |Dv|=500 및 B=|Dv| 조건에서 사전 분포가 알려지지 않은 상황에서 130번째 속성에 대해 94.00%의 정확도를 기록했으며, Nasr 등(2019)의 73.4% 기준선을 크게 상회했다.
  • 진짜 레이블이 알려지지 않았지만 사전 분포는 알려진 경우, Purchase2 및 Genome 데이터셋에서 레이블 재구성에 100%의 정확도를 달성했다.
  • cos-matching을 활용한 소속성 인식 공격는 50개의 샘플 레코드에서 99.00%의 정확도를 기록했으며, 73.4% 기준선을 뛰어넘었다.
  • 사전 분포가 알려지지 않았고 B=8인 조건에서도 Location의 첫 번째 속성에 대해 86.00%의 정확도를 유지하여 최소한의 가정 하에서도 강건성을 입증했다.
  • 사전 및 레이블 정보가 누락된 모든 설정에서 기준선(random, public100, public1000, stats)보다 공격 성능이 일관되게 높게 유지되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.