Skip to main content
QUICK REVIEW

[논문 리뷰] FedV: Privacy-Preserving Federated Learning over Vertically Partitioned Data

Runhua Xu, Nathalie Baracaldo|arXiv (Cornell University)|2021. 03. 05.
Privacy-Preserving Technologies in Data참고 문헌 57인용 수 16
한 줄 요약

FedV는 피어 투 피어 통신이 필요 없도록 기능 암호화를 사용하여 수직 분할된 데이터에 대해 기밀을 유지하는 분산 학습 프레임워크이다. 이는 여러 당사자 간에 비상호작용적인 기울기 집계를 가능하게 하여, 기존의 피어 투 피어 통신을 제거한다. 최신 기술 대비 학습 속도가 10%-70% 빠르고, 데이터 전송량이 80%-90% 줄어들며, 근사화나 노이즈 편향 없이 선형 모델, 로지스틱 회귀, 서포트 벡터 기반 모델을 지원한다.

ABSTRACT

Federated learning (FL) has been proposed to allow collaborative training of machine learning (ML) models among multiple parties where each party can keep its data private. In this paradigm, only model updates, such as model weights or gradients, are shared. Many existing approaches have focused on horizontal FL, where each party has the entire feature set and labels in the training data set. However, many real scenarios follow a vertically-partitioned FL setup, where a complete feature set is formed only when all the datasets from the parties are combined, and the labels are only available to a single party. Privacy-preserving vertical FL is challenging because complete sets of labels and features are not owned by one entity. Existing approaches for vertical FL require multiple peer-to-peer communications among parties, leading to lengthy training times, and are restricted to (approximated) linear models and just two parties. To close this gap, we propose FedV, a framework for secure gradient computation in vertical settings for several widely used ML models such as linear models, logistic regression, and support vector machines. FedV removes the need for peer-to-peer communication among parties by using functional encryption schemes; this allows FedV to achieve faster training times. It also works for larger and changing sets of parties. We empirically demonstrate the applicability for multiple types of ML models and show a reduction of 10%-70% of training time and 80% to 90% in data transfer with respect to the state-of-the-art approaches.

연구 동기 및 목표

  • 피어 투 피어 통신이나 근사 기법에 의존하는 기존 수직 분산 학습(VFL) 프레임워크의 비효율성과 확장성 한계를 해결하기 위해.
  • 단일 당사자가 모든 특징이나 레이블을 보유하지 않는 수직 분할된 데이터 환경에서 기밀을 유지하면서도 비상호작용적인 기울기 집계를 가능하게 하기 위해.
  • 타일러 급수 근사나 차별적 프라이버시 노이즈를 요구하지 않고도 선형 모델, 로지스틱 회귀, 서포트 벡터 머신(SVMs)을 포함한 다양한 기계 학습 모델을 지원하기 위해.
  • 동적 참가를 허용하여, 학습 중에 당사자가 참여하거나 이탈해도 집계 과정이 중단되지 않도록 하기 위해.
  • 기존의 보안 다자간 계산 또는 히든 암호화 기반 VFL 솔루션 대비 통신 오버헤드와 계산 비용을 줄이기 위해.

제안 방법

  • FedV는 기능 암호화(FE)를 활용하여 집계자가 개별 기울기를 알지 못한 채 여러 당사자로부터 온 기울기의 합을 계산할 수 있도록 하여 기밀성을 확보한다.
  • 프레임워크는 피어 투 피어 통신이 필요 없는 비상호작용적 보안 집계 프로토콜을 이중 단계로 구현한다.
  • 기능 암호화를 사용해 특징 벡터와 기울기 간의 내적을 안전하게 계산함으로써, 원시 데이터를暴露하지 않은 채 모델 업데이트를 가능하게 한다.
  • 이 방법은 선형 모델뿐 아니라 로지스틱 회귀와 커널 기반 SVM 등 비선형 모델도 타일러 급수 근사에 의존하지 않고 지원한다.
  • 당사자들은 기능 암호화를 사용해 로컬 기울기를 암호화하고, 집계자는 집계된 결과를 복호화하여 글로벌 모델을 업데이트한다.
  • 시스템은 동적 당사자 참가를 처리하도록 설계되어, 학습 중에 당사자가 참가하거나 이탈해도 재설정 없이도 작동한다.

실험 결과

연구 질문

  • RQ1피어 투 피어 통신이 없는 기밀 유지 수직 분산 학습 프레임워크를 설계할 수 있는가, 동시에 모델 정확도를 유지할 수 있는가?
  • RQ2기능 암호화를 효과적으로 활용해 수직 분할된 데이터 환경에서 기밀을 유지하면서도 비상호작용적인 기울기 집계를 가능하게 할 수 있는가?
  • RQ3FedV는 근사화나 노이즈 삽입 없이도 다양한 기계 학습 모델—특히 SVM과 같은 비선형 모델—을 지원할 수 있는가?
  • RQ4기존의 보안 다자간 계산 또는 히든 암호화 기반 VFL 솔루션과 비교해 FedV는 학습 효율성과 통신 비용 측면에서 어떻게 성능을 내는가?
  • RQ5FedV는 당사자가 학습 도중 참여하거나 이탈해도 보안성과 수렴성에 영향을 주지 않도록 동적 참가를 지원할 수 있는가?

주요 결과

  • FedV는 피어 투 피어 통신이나 보안 다자간 계산에 의존하는 최신 VFL 접근 방식 대비 학습 시간을 10%에서 70% 단축시킨다.
  • 피어 투 피어 통신의 다중 라운드가 필요 없어지면서 데이터 전송량이 80%에서 90% 감소한다.
  • FedV는 타일러 급수 근사 없이 선형 모델, 로지스틱 회귀, 커널 기반 SVM의 학습을 지원하여 모델 정확도를 유지한다.
  • 시스템은 동적 당사자 참가를 지원하여, 학습 도중 당사자가 참여하거나 이탈해도 집계 과정이 중단되지 않는다.
  • 기능 암호화 기반 집계는 개별 기울기나 원시 데이터를暴露하지 않으면서도 기밀 기울기 계산을 달성한다.
  • 특히 대규모 또는 네트워크가 불안정한 환경에서 기존 방법 대비 통신 효율성과 계산 비용 측면에서 FedV가 뛰어난 성능을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.