Skip to main content
QUICK REVIEW

[논문 리뷰] Computation-efficient Deep Model Training for Ciphertext-based Cross-silo Federated Learning

Xue Yang, Yan Feng|arXiv (Cornell University)|2020. 02. 23.
Privacy-Preserving Technologies in Data인용 수 6
한 줄 요약

이 논문은 암호화된 모델을 사용하여 비밀스럽게 훈련할 수 있도록 하는 계산 효율적인 딥러닝 프레임워크를 제안한다. 이는 비선형 활성화 함수와 소수 계산을 지원하는 새로운 일회용 패드 스타일 암호화 방법을 사용한다. 이 방법을 기반으로 기밀 공유 기법을 결합함으로써 서버와 클라이언트의 기밀성을 모두 보장하며, 9층의 MNIST 훈련에서 비기밀 기준 정확도와 훈련 속도를 한 시간 이내에 달성한다.

ABSTRACT

Although cross-silo federated learning improves privacy of training data by exchanging model updates rather than raw data, sharing updates (e.g., local gradients or parameters) may still involve risks. To ensure no updates are revealed to the server, industrial FL schemes allow clients (e.g., financial or medical) to mask local gradients by homomorphic encryption (HE). In this case, the server cannot obtain the updates, but the curious clients can obtain this information to infer other clients' private data. To alleviate this situation, the most direct idea is to let clients train deep models on encrypted domain. Unfortunately, the resulting solution is of poor accuracy and high cost, since the existing advanced HE is incompatible with non-linear activation functions and inefficient in terms of computational cost. In this paper, we propose a \emph{computational-efficient deep model training scheme for ciphertext-based cross-silo federated learning} to comprehensively guarantee privacy. First, we customize \emph{a novel one-time-pad-style model encryption method} to directly supports non-linear activation functions and decimal arithmetic operations on the encrypted domain. Then, we design a hybrid privacy-preserving scheme by combining our model encryption method with secret sharing techniques to keep updates secret from the clients and prevent the server from obtaining local gradients of each client. Extensive experiments demonstrate that for both regression and classification tasks, our scheme achieves the same accuracy as non-private approaches and outperforms the state-of-the-art HE-based scheme. Besides, training time of our scheme is almost the same as non-private approaches and much more efficient than HE-based schemes. Our scheme trains a $9$-layer neural network on the MNIST dataset in less than one hour.

연구 동기 및 목표

  • 클라이언트가 공유된 모델 업데이트를 통해 다른 클라이언트의 데이터를 유추할 수 있는 위험을 줄이기 위해 크로스실 연합 학습에서의 기밀 유출 위험을 해결한다.
  • 딥러닝에서의 고비용과 호환성 문제로 인해 비선형 활성화 함수와 호환되지 않는 동형 암호화의 문제를 해결한다.
  • 서버와 참여 클라이언트 양측의 모델 업데이트를 보호하는 안전하고 효율적이며 정확한 훈련 기법을 설계한다.
  • 기본 훈련 성능과 동일한 정확도와 훈련 시간을 확보하면서도 종단 간 기밀성을 보장한다.

제안 방법

  • 비선형 활성화 함수와 소수 계산을 지원하는 새로운 일회용 패드 스타일 모델 암호화 방법을 제안하여 암호화된 모델에서 직접 계산을 수행할 수 있도록 한다.
  • 기본 모델 암호화를 기밀 공유 기법과 통합하여, 클라이언트를 포함한 어느 단일 당사자도 국소 기울기를 재구성할 수 없도록 보장한다.
  • 암호화된 모델 업데이트를 클라이언트 간에 기밀 공유 방식으로 공유함으로써 서버가 개별 기울기를 알 수 없도록 하는 하이브리드 기밀 보장 기법을 설계한다.
  • 암호 해독 없이도 클라이언트 간에 암호화된 모델 업데이트를 안전하게 집계하여 훈련 과정 全주기 동안 기밀성을 유지한다.
  • 암호화 및 계산 파이프라인을 최적화하여 오버헤드를 최소화하고, 비기밀 훈련 수준에 근접한 효율성을 달성한다.
  • 기밀 보장과 성능의 균형을 고려해 동형 암호화와 기밀 공유를 융합한 하이브리드 아키텍처를 구현한다.

실험 결과

연구 질문

  • RQ1비선형 활성화 함수를 암호화된 모델에서 직접 지원하면서 성능 저하 없이 안전한 딥러닝 프레임워크를 설계할 수 있는가?
  • RQ2클라이언트가 서버에 모델 업데이트를 공유해야 하는 상황에서 크로스실 연합 학습에서 클라이언트의 기밀성을 어떻게 유지할 수 있는가?
  • RQ3하이브리드 암호화 및 기밀 공유 기법이 기존 HE 기반 접근 방식에 비해 높은 정확도와 저비용 훈련을 달성할 수 있는가?
  • RQ4암호화된 모델 기반 연합 학습에서 보안, 정확도, 효율성 간의 상호 상충 관계는 어떠한가?
  • RQ5종단 간 기밀성을 유지하면서도 9층 신경망을 MNIST에서 한 시간 이내에 훈련시킬 수 있는가?

주요 결과

  • 제안된 기법은 분류 및 회귀 작업 모두에서 비기밀 연합 학습과 동일한 모델 정확도를 달성한다.
  • MNIST 데이터셋에서 9층 신경망의 훈련 시간은 한 시간 이내이며, 비기밀 훈련과 동일한 효율성을 보인다.
  • 기존의 최첨단 동형 암호화 기반 접근 방식에 비해 훈련 속도에서 뚜렷한 성능 향상을 보인다.
  • 기존 HE 기반 기법의 핵심 제약 사항인 암호화된 데이터에서의 비선형 활성화 함수 및 소수 계산 지원에 성공적으로 대응한다.
  • 하이브리드 기밀 보장 메커니즘은 서버와 클라이언트 모두가 개별 클라이언트의 국소 기울기를 접근할 수 없도록 방지한다.
  • 어느 당사자도 손상된 경우에도 민감한 모델 업데이트를 재구성할 수 없도록 하여 높은 보안 수준을 유지를 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.