[논문 리뷰] Differentially Private Vertical Federated Learning
이 논문은 수직 분할된 데이터 간의 협업 학습에서 기밀성과 유티리티 사이의 실용적 트레이드오프를 달성하기 위해 학습 중 모델 기울기의 보정된 노이즈를 주입함으로써 기밀성을 향상시키는 차별적 비공개 수직 페더레이티드 러닝 프레임워크를 제안한다. 기밀성 예산과 모델 성능을 균형 잡는 방식으로, 이 접근법은 수직 분할된 데이터에서의 협업 학습에서 기밀 보호와 유티리티 사이의 균형을 이루게 된다.
A successful machine learning (ML) algorithm often relies on a large amount of high-quality data to train well-performed models. Supervised learning approaches, such as deep learning techniques, generate high-quality ML functions for real-life applications, however with large costs and human efforts to label training data. Recent advancements in federated learning (FL) allow multiple data owners or organisations to collaboratively train a machine learning model without sharing raw data. In this light, vertical FL allows organisations to build a global model when the participating organisations have vertically partitioned data. Further, in the vertical FL setting the participating organisation generally requires fewer resources compared to sharing data directly, enabling lightweight and scalable distributed training solutions. However, privacy protection in vertical FL is challenging due to the communication of intermediate outputs and the gradients of model update. This invites adversary entities to infer other organisations underlying data. Thus, in this paper, we aim to explore how to protect the privacy of individual organisation data in a differential privacy (DP) setting. We run experiments with different real-world datasets and DP budgets. Our experimental results show that a trade-off point needs to be found to achieve a balance between the vertical FL performance and privacy protection in terms of the amount of perturbation noise.
연구 동기 및 목표
- 동일한 사용자 기반에서 원천 데이터를 공유하지 않고 특징을 공유하는 수직 페더레이티드 러닝(VFL) 환경에서 민감한 데이터를 보호하는 도전 과제를 해결한다.
- VFL 학습 중 교환되는 중간 모델 업데이트 및 기울기에서 발생하는 기밀성 泄露를 완화한다.
- 개인 조직의 데이터가 공유된 기울기에서 재구성될 수 없음을 보장하는 공식적인 기밀성 보장으로서의 차별적 기밀성(DP)을 도입한다.
- 실증적 평가를 통해 기밀성(DP 예산)과 모델 성능 사이의 최적 트레이드오프를 규명한다.
- 실제 환경에서 수직 분할된 데이터를 가진 협업 기계학습을 위한 확장 가능하고 경량의 솔루션을 제공한다.
제안 방법
- 데이터 소유자와 중앙 서버 간에 교환되는 기울기에 보정된 노이즈를 주입하여 수직 페더레이티드 러닝의 기울기 업데이트에 차별적 기밀성을 적용한다.
- 기울기 업데이트의 민감도를 제한하기 위해 기울기 클리핑을 사용하며, 이는 차별적 기밀성 적용의 전제 조건이다.
- VFL 학습 중 확률적 기울기 하강(SGD) 최적화 과정에 DP 노이즈 주입을 통합한다.
- 라플라스 메커니즘을 적용하여 기울기를 왜곡함으로써 각 업데이트에 대해 (ε, δ)-차별적 기밀성을 확보한다.
- 실제 데이터셋을 사용하여 다양한 DP 예산(ε)이 모델 정확도와 기밀성 보장에 미치는 영향을 평가한다.
- 클리핑 노름과 기밀성 예산에 기반한 노이즈 스케일을 조정하여 성능 저하를 최소화함으로써 모델 유티리티를 유지한다.
실험 결과
연구 질문
- RQ1민감한 데이터의 추론 공격으로부터 보호하기 위해 차별적 기밀성이 수직 페더레이티드 러닝에 효과적으로 적용될 수 있는 방법은 무엇인가?
- RQ2VFL에서 기울기에 DP 노이즈를 적용할 경우, 모델 성능과 기밀성 보호 사이의 트레이드오프는 어떻게 되는가?
- RQ3VFL에서 DP 예산(ε)을 변화시킬 경우, 글로벌 모델의 정확도와 수렴에 어떤 영향을 미치는가?
- RQ4특히 한 당사자가 레이블을 보유하고 있고 다른 당사자가 특징을 보유할 경우, DP 노이즈 주입이 레이블 추론 공격을 방지할 수 있는가?
- RQ5VFL에서 기밀성과 모델 유티리티를 균형 잡기 위해 클리핑 노름과 노이즈 스케일의 최적 설정은 무엇인가?
주요 결과
- 기밀성 예산(ε)을 증가시킬수록 모델 정확도는 향상되지만 기밀성 보장은 감소하므로, 모델 성능과 기밀성 보호 사이의 트레이드오프가 필수적이다.
- VFL에서 기울기에 DP 노이즈를 추가하면 모델 유티리티가 감소하지만, 클리핑 노름과 노이즈 스케일을 신중히 조정함으로써 영향을 최소화할 수 있다.
- 실제 데이터셋에 대한 실증 결과는 중간 정도의 DP 예산(예: ε ≈ 1–3)이 기밀성과 모델 정확도 사이에 합리적인 균형을 이룰 수 있음을 보여준다.
- 특히 한 당사자가 민감한 레이블을 보유하고 있을 경우에도, 기울기 정보를 은폐함으로써 제안된 방법이 레이블 추론 공격의 위험을 효과적으로 완화한다.
- 이 프레임워크는 확장성과 효율성을 유지하므로, 원천 데이터를 공유하기를 꺼리는 실세계 응용 분야에 적합하다.
- 본 연구는 페더레이티드 언러닝 및 윤리적 데이터 사용과 같은 기밀성 보존 메커니즘에 대한 향후 연구의 필요성을 부각시킨다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.