Skip to main content
QUICK REVIEW

[논문 리뷰] Protecting Data from all Parties: Combining FHE and DP in Federated Learning

Arnaud Grivet Sébert, Renaud Sirdey|arXiv (Cornell University)|2022. 05. 09.
Cryptography and Data Security인용 수 7
한 줄 요약

이 논문은 동료, 서버, 최종 사용자 모두의 훈련 데이터 기밀성을 동시에 보호하기 위해 히스토그램 암호화(HE)와 차별적 비밀성(DP)을 조합한 새로운 분산 학습 프레임워크를 제안한다. HE의 양자화 제약 조건에도 불구하고 DP 보장을 유지하기 위해 포isson 분포 기반의 확률적 양자화 연산자를 도입하여, FEMNIST에서 실용적인 모델 정확도와 계산 가능성을 입증한다.

ABSTRACT

This paper tackles the problem of ensuring training data privacy in a federated learning context. Relying on Homomorphic Encryption (HE) and Differential Privacy (DP), we propose a framework addressing threats on the privacy of the training data. Notably, the proposed framework ensures the privacy of the training data from all actors of the learning process, namely the data owners and the aggregating server. More precisely, while HE blinds a semi-honest server during the learning protocol, DP protects the data from semi-honest clients participating in the training process as well as end-users with black-box or white-box access to the trained model. In order to achieve this, we provide new theoretical and practical results to allow these techniques to be rigorously combined. In particular, by means of a novel stochastic quantisation operator, we prove DP guarantees in a context where the noise is quantised and bounded due to the use of HE. The paper is concluded by experiments which show the practicality of the entire framework in terms of both model quality (impacted by DP) and computational overhead (impacted by HE).

연구 동기 및 목표

  • 모델 업데이트를 통해 민감한 데이터를 유추할 수 있는 반신뢰성 클라이언트 및 서버가 초래하는 기밀성 위협을 해결한다.
  • 데이터 소유주, 참여 클라이언트, 서버, 모델 접근 권한이 있는 최종 사용자까지 모든 주체로부터 데이터를 보호함으로써 종단 간 기밀성을 확보한다.
  • 소음 주입이 필요한 차별적 비밀성(DP)과 유한하고 양자화된 입력이 필요한 히스토그램 암호화(HE) 간의 상충 관계를 해결한다.
  • HE 제약 조건으로 인해 소음까지 양자화되는 상황에서도 DP 보장을 유지할 수 있는 양자화 메커니즘을 설계한다.
  • HE+DP 프레임워크의 실용성을 모델 정확도, 기밀성 비용, 계산 오버헤드 측면에서 입증한다.

제안 방법

  • 전송 전에 철저히 파rameter화된 가우시안 소음을 주입하여 클라이언트 업데이트에 차별적 비밀성을 적용한다.
  • 클라이언트 업데이트를 서버에 전송하기 전에 암호화하여 서버가 원시 데이터나 중간 결과를 접근할 수 없도록 보장한다.
  • 연속적인 소음이 가미된 기울기를 HE에 적합한 이산 값으로 매핑하기 위해 포isson 분포 기반의 새로운 확률적 양자화 연산자를 도입한다.
  • 제안된 양자화가 기본 가우시안 메커니즘의 차별적 비밀성 보장을 유지함을 증명하며, 추가적인 기밀성 분석이 필요하지 않다.
  • 소음 주입 후 처리 단계로 양자화 연산자를 통합하여, 양자화가 이루어져도 기밀성 예산이 그대로 유지됨을 보장한다.
  • 의료 또는 기관 협업과 유사한 현실적인 파arameter를 적용한 크로스실러 FL 환경에서 프레임워크를 구현하고, FEMNIST 데이터셋을 기반으로 평가한다.

실험 결과

연구 질문

  • RQ1차별적 비밀성과 히스토그램 암호화를 분산 학습에서 엄격하게 융합할 수 있는가? 이 과정에서 기밀성 보장이 손상되지 않는가?
  • RQ2히스토그램 암호화 제약 조건으로 인해 소음까지 양자화되는 상황에서, 차별적 비밀성이 어떻게 유지될 수 있는가?
  • RQ3DP와 HE를 원활하게 통합하면서 모든 당사자로부터 종단 간 기밀성을 유지할 수 있는 양자화 메커니즘은 무엇인가?
  • RQ4분산 학습 파이프라인에 HE와 DP를 동시에 적용할 경우, 모델 정확도와 계산 오버헤드 사이의 상충 관계는 어떻게 되는가?
  • RQ5의료 AI와 같이 데이터 민감도와 기관 간 협업이 중요한 실세계 응용에 프레임워크가 확장 가능한가?

주요 결과

  • 포isson 분포 기반의 제안된 확률적 양자화 연산자는 기본 가우시안 메커니즘의 차별적 비밀성 보장을 유지하며, 추가적인 기밀성 분석이 필요하지 않다.
  • 프레임워크는 종단 간 기밀성을 보장한다: HE를 통해 서버로부터, DP를 통해 클라이언트 및 최종 사용자로부터 데이터가 보호된다.
  • FEMNIST 데이터셋에 대한 실험 결과, 기밀성 보장 메커니즘이 적용됨에도 불구하고 모델은 수용 가능한 정확도를 유지하며, DP로 인한 성능 저하가 측정 가능하지만 관리 가능하다.
  • 히스토그램 암호화로 인한 계산 오버헤드는 제한되어 있으며, 중간 수준의 클라이언트 수를 가진 크로스실러 환경에서는 실용적이다.
  • 활성 클라이언트 수 대비 총 클라이언트 수의 비율($K/M$)이 DP 유틸리티에 큰 영향을 미치며, $M$을 증가시킬수록 기밀성 보장은 향상되고 모델 성능은 유지된다.
  • 프레임워크는 검증 가능한 계산 확장 기능과도 호환되어, 향후 악성 서버에 대한 내성 강화 방향으로의 전망을 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.