Skip to main content
QUICK REVIEW

[논문 리뷰] Revocable Federated Learning: A Benchmark of Federated Forest

Yang Liu, Zhuo Ma|arXiv (Cornell University)|2019. 11. 08.
Privacy-Preserving Technologies in Data참고 문헌 36인용 수 8
한 줄 요약

이 논문은 참가자 추방 기능을 지원하는 보안적이고 프라이버시를 보장하는 분산 학습을 위한 새로운 프레임워크인 Revocable Federated Random Forest (RevFRF)를 소개한다. 동형 암호화를 사용하여 RevFRF는 국소 데이터를 폭 드러내지 않은 채 랜덤 포레스트 모델을 구축하고 예측할 수 있으며, 추방된 참가자의 기여도를 모델에서 안전하게 제거함으로써 실제 협업 환경에서 높은 효율성과 강력한 프라이버시 보장을 달성한다.

ABSTRACT

A learning federation is composed of multiple participants who use the federated learning technique to collaboratively train a machine learning model without directly revealing the local data. Nevertheless, the existing federated learning frameworks have a serious defect that even a participant is revoked, its data are still remembered by the trained model. In a company-level cooperation, allowing the remaining companies to use a trained model that contains the memories from a revoked company is obviously unacceptable, because it can lead to a big conflict of interest. Therefore, we emphatically discuss the participant revocation problem of federated learning and design a revocable federated random forest (RF) framework, RevFRF, to further illustrate the concept of revocable federated learning. In RevFRF, we first define the security problems to be resolved by a revocable federated RF. Then, a suite of homomorphic encryption based secure protocols are designed for federated RF construction, prediction and revocation. Through theoretical analysis and experiments, we show that the protocols can securely and efficiently implement collaborative training of an RF and ensure that the memories of a revoked participant in the trained RF are securely removed.

연구 동기 및 목표

  • 훈련된 모델에 남아 있는 추방된 참가자의 데이터가 여전히 임베딩되어 있는 분산 학습의 심각한 프라이버시 격차를 해결하기 위해.
  • 모델 유틸리티를 훼손하지 않으면서도 참가자 추방 기능을 지원하는 보안적이고 효율적인 프레임워크를 설계하기 위해.
  • 특히 헬스케어나 기업 환경과 같은 다자 협업 상황에서의 참가자 추방 프라이버시 보장 문제를 체계적으로 정의하고 해결하기 위해.
  • 보안적 모델 구축, 예측, 그리고 추방 기능이 분산 랜덤 포레스트 환경에서 동형 암호화를 통해 효율적으로 이뤄질 수 있음을 입증하기 위해.

제안 방법

  • 국소 데이터를 폭 드러내지 않고 트리 노드를 집계할 수 있도록 동형 암호화(HE)를 사용한 보안적 분산 랜덤 포레스트 구축 프로토콜 설계.
  • 각 참가자가 자신의 공개 키로 트리 노드를 암호화하는 다중 키 HE 기반 설계로, 안전한 집계와 분산 신뢰를 가능하게 함.
  • 암호화된 입력이나 모델 구조를 폭 드러내지 않은 채 암호화된 모델에서 암호화된 질의를 평가할 수 있도록 하는 보안 예측 프로토콜 개발.
  • 두 단계로 구성된 추방 프로토콜 도입: 제1단계는 추방된 참가자의 기여도를 모델에서 제거하고, 제2단계는 잔여 정보가 남지 않도록 보장함.
  • 랜덤 결정 트리(RDT) 노드당 한 번의 HE 적용만으로도 효율을 극대화하여, 전체 데이터셋 암호화 대비 계산 오버헤드를 최소화함.
  • 모델 재구성과 추방 기능을 효율적으로 지원하는 분산형 암호화된 형식으로 RDT 노드 저장.

실험 결과

연구 질문

  • RQ1참가자 추방 기능을 지원하는 분산 학습 프레임워크는 훈련된 모델에서 추방된 참가자의 데이터를 완전히 제거할 수 있는가?
  • RQ2국소 데이터나 예측 요청을 폭 드러내지 않은 채로 분산 랜덤 포레스트에서 안전한 집계와 예측을 어떻게 달성할 수 있는가?
  • RQ3비추방 기능을 갖춘 대안 대비, 분산 랜덤 포레스트 프레임워크에서 추방 기능을 구현할 경우 성능 오버헤드는 얼마나 되는가?
  • RQ4분산 랜덤 포레스트의 구축 및 예측 과정에서 동형 암호화의 사용을 최적화하여 계산 비용과 통신 비용을 줄일 수 있는가?

주요 결과

  • RevFRF는 두 단계로 구성된 보안적 참가자 추방을 달성한다: 제1단계는 참가자의 기여도를 모델에서 제거하고, 제2단계는 잔여 데이터 흔적도 남지 않도록 보장한다.
  • RDT 노드당 한 번의 암호화만으로도 이전 연구(Rana et al., 2015) 대비 계산 비용을 2000배 이상 감소시켜 트리 구축 단계에서 높은 효율성 확보.
  • 100개의 RDT 노드와 5000개의 샘플을 기준으로 RevFRF의 계산 비용은 구축 시 3.09초, 예측 시 13.33초로, 경쟁 프로토콜 대비 유의미하게 낮음.
  • 구축 시 통신 비용은 1.07MB로 최소화되고 예측 시 0.78MB로 유지되어 이전의 HE 기반 방법들보다 두 성능 지표에서 모두 뛰어남.
  • 5명의 참가자가 추방된 상황에서 RevFRF는 모델을 9.8초 내로 재구성하지만, 추방 불가능한 프레임워크(IRev.Fed)는 31.1초가 소요되어 RevFRF의 효율성 우월성을 입증.
  • 실험 결과는 RDT 노드 수와 트리 깊이 증가에 따라 계산 및 통신 비용이 선형 증가하는 경향을 보이며, 이는 이론적 분석과 일치함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.