[논문 리뷰] PIVODL: Privacy-preserving vertical federated learning over distributed labels
PIVODL는 레이블이 여러 클라이언트에 분산되어 있는 경우 XGBoost 모델을 훈련하기 위한 프라이버시 보장 수직 연합 학습 프레임워크를 제안한다. 이는 동형 암호화와 부분적 차별적 프라이버시를 결합하여 기울기와 리프 가중치 전송 중 레이블 정보 泄漏를 방지하며, 성능 저하가 거의 없고 인퍼런스 공격 조건에서도 강력한 프라이버시 보장을 달성한다.
Federated learning (FL) is an emerging privacy preserving machine learning protocol that allows multiple devices to collaboratively train a shared global model without revealing their private local data. Non-parametric models like gradient boosting decision trees (GBDT) have been commonly used in FL for vertically partitioned data. However, all these studies assume that all the data labels are stored on only one client, which may be unrealistic for real-world applications. Therefore, in this work, we propose a secure vertical FL framework, named PIVODL, to train GBDT with data labels distributed on multiple devices. Both homomorphic encryption and differential privacy are adopted to prevent label information from being leaked through transmitted gradients and leaf values. Our experimental results show that both information leakage and model performance degradation of the proposed PIVODL are negligible.
연구 동기 및 목표
- 레이블이 한 당사자에 집중되어 있지 않고 여러 클라이언트에 분산되어 있는 현실적인 수직 연합 학습 시나리오를 다루기 위해.
- 레이블이 클라이언트 간에 분할되어 있을 경우 기울기와 리프 가중치 전송으로 인한 프라이버시 위험을 완화하기 위해.
- 특성 분할 간 기울기와 헤시안 합의 차이를 악용하는 차별적 공격을 방지하기 위해.
- 모델 인퍼런스 중에 클라이언트가 리프 가중치 값으로 진짜 레이블을 추측하는 것을 방지하여 레이블 프라이버시를 보호하기 위해.
- 분산된 레이블 환경에서 기울기 부스팅 결정 트리 훈련을 위한 안전하고 효율적이며 프라이버시 보장된 프레임워크를 개발하기 위해.
제안 방법
- 소스 클라이언트와 스플릿 클라이언트가 함께 기울기 정보를 노출하지 않고 불순도 점수를 공동으로 계산하는 보안적 노드 분할 프로토콜을 도입한다.
- 수직 연합 학습 중 트리 노드 분할 시 기울기와 헤시안을 안전하게 집계하기 위해 덧셈형 동형 암호화(Paillier)를 사용한다.
- 리프 가중치 값에만 가우시안 노이즈를 추가하여 소스 클라이언트로 전송하는 방식으로, 레이블 추론을 방지하기 위해 부분적 차별적 프라이버시 메커니즘을 구현한다.
- XGBoost 훈련 과정을 데이터 분할 및 스플릿 점수 계산을 위한 클라이언트별 계산으로 분해하여 레이블 관련 데이터 폭 lộ를 최소화한다.
- 암호화되거나 흐린 중간 값만 공유되도록 통신 효율적인 프로토콜을 설계하여 데이터 국지성 보장한다.
- 기울기, 헤시안, 리프 가중치 등 모든 민감한 정보가 암호화 및 프라이버시 보장 기법을 통해 보호되도록 보장한다.
실험 결과
연구 질문
- RQ1레이블이 여러 클라이언트에 분산되어 있을 경우, XGBoost를 위한 보안적 수직 연합 학습 시스템을 설계할 수 있는가?
- RQ2레이블이 한 클라이언트에 존재하지 않을 경우, 기울기와 헤시안 집계를 어떻게 안전하게 수행할 수 있는가?
- RQ3특성 분할 간 기울기 합의 차이를 악용하는 차별적 프라이버시 공격을 방지하기 위한 메커니즘은 무엇인가?
- RQ4모델 성능 저하 없이 레이블 추론을 방지하기 위해 차별적 프라이버시를 리프 가중치에만 선택적으로 적용할 수 있는가?
- RQ5제안된 시스템은 인퍼런스 공격 조건에서도 모델 정확도를 어느 정도 유지하면서도 레이블 프라이버시를 보장하는가?
주요 결과
- 제안된 PIVODL 프레임워크는 모델 성능 저하가 거의 없으며, 테스트 성능이 차별적 프라이버시 수준(ε)의 변화에 대해 상대적으로 민감하지 않다.
- 차별적 프라이버시를 적용하지 않은 경우, 크레딧 카드 및 뱅크 마케팅 데이터셋에서 레이블 추론 공격에 대한 추측 정확도가 각각 60% 이상을 초과하여 레이블 泄漏의 고위험성을 시사한다.
- ε = 10일 때 부분적 차별적 프라이버시를 적용한 결과, 뱅크 마케팅 데이터셋에서는 추측 정확도가 14.45%로 떨어지고, 크레딧 카드 데이터셋에서는 27.78%로 감소하여 랜덤 추측 기준 50% 이하로 떨어진다.
- 동형 암호화의 사용으로 통신 비용이 최대 25MB 증가했지만, Appliance energy prediction 데이터셋의 여섯 개 부스팅 트리 모델 기준로는 관리 가능한 수준으로 간주된다.
- 암호화로 인해 훈련 시간이 크게 영향을 받으며, 동형 암호화가 총 훈련 시간의 대부분을 차지함을 시사하여 최적화가 필요함을 나타낸다.
- 부분적 차별적 프라이버시 메커니즘이 효과적으로 클라이언트가 리프 가중치 분석을 통해 진짜 레이블을 추론하는 것을 방지하여, 인퍼런스 중에 레이블 정보가 泄漏되지 않음을 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.