Skip to main content
QUICK REVIEW

[논문 리뷰] FedXGBoost: Privacy-Preserving XGBoost for Federated Learning

Nhan Khanh Le, Yang Liu|arXiv (Cornell University)|2021. 06. 20.
Privacy-Preserving Technologies in Data참고 문헌 18인용 수 9
한 줄 요약

FedXGBoost는 손실 없는 정확도를 달성하면서 암호화 기반 방법보다 낮은 오버헤드를 가지는 두 가지 프라이버시 보장 프로토콜 — FedXGBoost-SMM 및 FedXGBoost-LDP — 를 도입한다. 분할 기반 스플릿 점수 계산을 보안 행렬 곱셈으로 재구성하고, 부정성 기반 강화를 통해 정확도 손실 없이 프라이버시를 보장하는 FedXGBoost-SMM와, 노이즈 편향을 적용한 국소적 차별적 프라이버시를 사용하여 실용적인 구현을 위한 FedXGBoost-LDP를 제안한다.

ABSTRACT

Federated learning is the distributed machine learning framework that enables collaborative training across multiple parties while ensuring data privacy. Practical adaptation of XGBoost, the state-of-the-art tree boosting framework, to federated learning remains limited due to high cost incurred by conventional privacy-preserving methods. To address the problem, we propose two variants of federated XGBoost with privacy guarantee: FedXGBoost-SMM and FedXGBoost-LDP. Our first protocol FedXGBoost-SMM deploys enhanced secure matrix multiplication method to preserve privacy with lossless accuracy and lower overhead than encryption-based techniques. Developed independently, the second protocol FedXGBoost-LDP is heuristically designed with noise perturbation for local differential privacy, and empirically evaluated on real-world and synthetic datasets.

연구 동기 및 목표

  • 기존 암호화 기반 방법에서 발생하는 높은 오버헤드로 인해 효율적이고 프라이버시 보장이 가능한 분산 XGBoost의 부족을 해결한다.
  • 동형 암호화보다 계산 비용을 줄이고 정확도 손실 없이 프라이버시를 보장하는 보안 행렬 곱셈 기반 프로토콜(FedXGBoost-SMM)을 개발한다.
  • 실세계 및 합성 데이터셋에서 수용 가능한 성능을 보이며 실용적인 배포가 가능한 히우리스틱 국소적 차별적 프라이버시 프로토콜(FedXGBoost-LDP)을 설계한다.
  • 보안 행렬 곱셈 및 동형 암호화에서 발생할 수 있는 프라이버시 泄露 위험을 강화된 부정성 기반 기법으로 완화하고, 내재된 취약점을 분석한다.
  • 수직 분할된 분산 환경에서 프라이버시 보장이 가능한 XGBoost의 실현 가능성과 실용성을 입증하며, 모델 성능 저하 없이 구현한다.

제안 방법

  • 범주형 행렬과 기울기 벡터 간의 보안 행렬 곱셈(SMM) 문제로 XGBoost의 스플릿 점수 평가를 재구성한다.
  • 정확한 행렬 요소를 추론할 수 없도록, 특히 극단적인 호기심을 가진 당사자에 대비해 SMM 프로토콜에 부정성 메커니즘을 통합한다.
  • XGBoost 목적 함수의 1차 근사법을 적용하여 노이즈가 있는 기울기에 대한 불편 추정량을 도출함으로써 정확한 스플릿 점수 계산을 가능하게 한다.
  • 개별 데이터 기여도를 보호하기 위해 기울기와 헤시안에 노이즈 편향을 적용한 국소적 차별적 프라이버시를 사용하여 FedXGBoost-LDP를 설계한다.
  • 각 클라이언트가 서로 다른 특징을 보유하는 수직 데이터 분할 방식을 적용하여 원시 데이터를 공유하지 않고도 협업 학습이 가능하도록 한다.
  • 모델 정확도를 유지하면서도 차별적 프라이버시 보장을 보장하는 분산 XGBoost 학습 파이프라인에 프라이버시 보장 프로토콜을 통합한다.

실험 결과

연구 질문

  • RQ1보안 행렬 곱셈을 어떻게 개선하여 분산 XGBoost에서 강력한 프라이버시 보장을 제공하면서 정확도 손실 없이 낮은 계산 비용을 확보할 수 있는가?
  • RQ2XGBoost에 적용했을 때 기존 보안 행렬 곱셈 및 동형 암호화 프로토콜에서 발생하는 내재된 프라이버시 泄露 위험은 무엇이며, 이를 어떻게 완화할 수 있는가?
  • RQ3제안된 FedXGBoost-LDP 프로토콜은 실세계 및 합성 데이터셋에서 모델 성능과 프라이버시 간의 트레이드오프 측면에서 어떻게 성능을 발휘하는가?
  • RQ4FedXGBoost-SMM처럼 선형 대수 기반 접근 방식이 분산 XGBoost에서 효율성과 정확도 측면에서 암호화 기반 방법보다 뛰어나게 성능을 발휘할 수 있는가?
  • RQ5XGBoost 목적 함수의 1차 근사법은 노이즈 주입 상황에서 스플릿 점수 추정량의 편향을 어떻게 제거할 수 있는가?

주요 결과

  • FedXGBoost-SMM는 스플릿 점수 계산을 보안 행렬 곱셈으로 재구성하고, 부정성 기반 강화를 통해 동형 암호화보다 오버헤드를 줄이며 손실 없는 모델 정확도를 달성한다.
  • 강화된 SMM 프로토콜은 범주형 데이터일지라도 극단적인 호기심을 가진 당사자가 진짜 행렬 값을 추론할 확률을 매우 낮춘다.
  • FedXGBoost-LDP는 국소적 차별적 프라이버시와 노이즈 편향을 적용한 실용적인 히우리스틱을 제공하여 실세계 및 합성 데이터셋에서 수용 가능한 모델 성능을 달성한다.
  • XGBoost 목적 함수의 1차 근사법은 노이즈 주입 상황에서도 스플릿 점수 추정량에 대한 편향 없는 추정량을 가능하게 하여 모델 성능 저하 없이 유지한다.
  • 노이즈 상황에서 스플릿 점수 추정량의 분산은 해석적으로 유계이며, 분산은 증가하지만 추정량은 여전히 편향이 없음을 보여준다.
  • 실증적 평가 결과, FedXGBoost-LDP는 실세계 데이터셋에서도 경쟁 가능한 성능을 유지함으로써 XGBoost를 활용한 프라이버시 보장 분산 학습의 실용성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.