Skip to main content
QUICK REVIEW

[논문 리뷰] Quantification of the Leakage in Federated Learning

Zhaorui Li, Zhicong Huang|arXiv (Cornell University)|2019. 10. 12.
Privacy-Preserving Technologies in Data참고 문헌 12인용 수 13
한 줄 요약

이 논문은 이방성 근사 로지스틱 회귀에서의 데이터 泄漏를 정량화하며, 동기화된 환경에서는 수동이지만 호기심이 많은 참가자가 기울기 분석을 통해 다른 당사자의 이진 훈련 데이터를 완전히 재구성할 수 있음을 보여준다. 이방성 환경에서는 부분적인 제약만 유추할 수 있으며, 배치 크기와 참가자 수가 증가할수록 泄漏가 증가한다.

ABSTRACT

With the growing emphasis on users' privacy, federated learning has become more and more popular. Many architectures have been raised for a better security. Most architecture work on the assumption that data's gradient could not leak information. However, some work, recently, has shown such gradients may lead to leakage of the training data. In this paper, we discuss the leakage based on a federated approximated logistic regression model and show that such gradient's leakage could leak the complete training data if all elements of the inputs are either 0 or 1.

연구 동기 및 목표

  • 이진 입력을 사용하는 근사 로지스틱 회귀를 사용할 때 연합 학습에서의 데이터 泄漏 정도를 분석하기 위해.
  • 특히 덧셈형 동형 암호화 및 근사화 기법을 적용할 경우, 연합 학습에서 기울기 정보가 완전한 훈련 데이터를 泄漏할 수 있는지 조사하기 위해.
  • 다양한 당사자에 대해 동기화 및 이방성 훈련 환경에서의 泄漏를 정량화하기 위해.
  • 배치 크기 및 참가자 수와 같은 하이퍼파라미터가 데이터 재구성 위험에 미치는 영향을 평가하기 위해.
  • 연합 학습 시스템에서 기울기 기반 데이터 泄漏에 대비한 실용적 방어 조치를 제안하기 위해.

제안 방법

  • Aono 등(2016)의 방법을 활용해 시그모이드 함수를 근사화함으로써 동형 암호화를 가능하게 하는 연합 근사 로지스틱 회귀 모델을 사용한다.
  • 훈련 과정을 기울기를 안전하게 집계하는 방식(secure aggregation, Aono 등, 2017)을 사용하는 이중 또는 다중 참가자 설정으로 모델링한다.
  • 동기화 모드에서 기울기 집계 결과로부터 선형 방정식을 유도하여 입력 데이터 행렬을 재구성한다.
  • 희소성과 이진 제약 조건을 활용해 기울기 및 모델 파라미터 쌍에서 이진 입력 데이터를 구하기 위해 선형 프로그래밍을 적용한다.
  • 이방성 모드에서는 기울기 및 모델 업데이트의 곱항을 포함하는 행렬 방정식을 유도하여 데이터에 대한 제약 조건을 도출하며, 무한한 해 공간이 존재함을 보여준다.
  • Intel i5-8500 CPU에서 PuLP 라이브러리를 사용해 재구성 시간을 실험적으로 평가하며, 배치 크기 및 특성 차원을 다양하게 조정한다.

실험 결과

연구 질문

  • RQ1이진 입력을 사용하는 연합 로지스틱 회귀에서, 수동이지만 호기심이 많은 참가자가 다른 당사자의 완전한 훈련 데이터를 재구성할 수 있는가?
  • RQ2동기화 모드(동기화 대비 이방성)가 기울기 경로를 통해 유출되는 정보의 양에 어떤 영향을 미치는가?
  • RQ3배치 크기 및 참가자 수가 데이터 재구성의 가능성과 완전성에 어떤 영향을 미치는가?
  • RQ4데이터 셔플링 또는 선택적 기울기 전송과 같은 훈련 절차 수정을 통해 기울기 泄漏를 완화할 수 있는가?
  • RQ5시스템이 유일한 데이터 재구성을 허용하는 조건은 언제이며, 언제는 부분적인 제약만을 제공하는가?

주요 결과

  • 동기화 설정에서는, 기울기 샘플 수가 특성 차원을 초과할 경우, 기울기 및 모델 파라미터 쌍만으로도 다른 당사자의 훈련 데이터를 완전히 재구성할 수 있다.
  • 기울기 표현에서 유도된 선형 방정식 시스템을 해결함으로써, 입력의 이진성 특성을 활용해 정수 프로그래밍 문제로 문제를 축소함으로써 재구성을 달성한다.
  • 배치 크기가 증가함에 따라 동일한 기울기를 생성할 수 있는 다양한 데이터 배치가 존재하게 되어 재구성에 모호성이 발생하며, 실험에서 다수의 일치하는 배치가 나타남을 통해 이를 입증한다.
  • 이방성 설정에서는 방정식 시스템이 무한한 해를 가지므로, 데이터 자체가 아닌 제약 조건만 추론 가능하며, 이는 완전한 재구성 위험을 크게 감소시킨다.
  • 특성 차원과 배치 크기가 증가할수록 재구성 문제를 해결하는 데 소요되는 시간이 급격히 증가하며, 11개의 샘플과 20개의 특성에 대해 1600초 이상 소요되어 대규모 데이터에선 계산적으로 비현실적임을 보여준다.
  • 데이터 셔플링 또는 선택적 기울기 전송과 같은 방어 조치는 기울기를 흐리게 하여 泄漏 위험을 감소시키며, 특히 이방성 환경에서 효과적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.