[논문 리뷰] Vertical Federated Learning without Revealing Intersection Membership
이 논문은 수직联邦학습(vFL) 프레임워크를 제안하며, 기존의 비밀 집합 교차(PSI) 대신 비밀 집합 합집합(PSU) 프로토콜을 사용하여 교차 멤버십 정보의 기밀성을 보호한다. 이는 공유되는 데이터 엔티티의 교차 멤버십이 아닌 유니온만 드러내며, 공유되지 않는 샘플에 대해 합성 특징과 레이블을 생성함으로써, 모든 조직이 공유하는 엔티티를 파악하지 못하도록 하면서도 높은 모델 유틸리티를 유지한다.
Vertical Federated Learning (vFL) allows multiple parties that own different attributes (e.g. features and labels) of the same data entity (e.g. a person) to jointly train a model. To prepare the training data, vFL needs to identify the common data entities shared by all parties. It is usually achieved by Private Set Intersection (PSI) which identifies the intersection of training samples from all parties by using personal identifiable information (e.g. email) as sample IDs to align data instances. As a result, PSI would make sample IDs of the intersection visible to all parties, and therefore each party can know that the data entities shown in the intersection also appear in the other parties, i.e. intersection membership. However, in many real-world privacy-sensitive organizations, e.g. banks and hospitals, revealing membership of their data entities is prohibited. In this paper, we propose a vFL framework based on Private Set Union (PSU) that allows each party to keep sensitive membership information to itself. Instead of identifying the intersection of all training samples, our PSU protocol generates the union of samples as training instances. In addition, we propose strategies to generate synthetic features and labels to handle samples that belong to the union but not the intersection. Through extensive experiments on two real-world datasets, we show our framework can protect the privacy of the intersection membership while maintaining the model utility.
연구 동기 및 목표
- 수직联邦학습에서 조직 간에 공유되는 데이터 엔티티가 무엇인지 파악하는 중요한 기밀 유출 문제를 해결한다.
- 기존의 PSI 기반 vFL 시스템이 모든 당사자에게 교차 멤버십를 폭 드러내는 한계를 극복한다.
- 의료 및 금융과 같은 기밀성이 중요한 분야에서 민감한 멤버십 정보를 보호하는 보안적인 수직联邦학습 프레임워크를 개발한다.
- 공유되지 않는 샘플에 대해 합성 데이터를 사용하더라도 높은 모델 유틸리티를 유지한다.
- 모든 당사자가 동시에 보호되는 첫 번째 솔루션을 제공한다. 단일 또는 비대칭적으로만 보호하는 것이 아니라 전면적으로 보장한다.
제안 방법
- 기존의 비밀 집합 교차(PSI) 대신, 훈련 샘플의 유니온을 식별하는 새로운 비밀 집합 합집합(PSU) 프로토콜을 도입한다.
- 교차 샘플 ID를 폭 드러내지 않는 안전한 데이터 정렬 메커니즘을 설계하여 멤버십 泄露를 방지한다.
- 교차에 속하지 않지만 유니온에 포함된 샘플에 대해 합성 특징과 레이블 생성 전략을 도입하여 모든 가용 데이터로 모델 훈련을 가능하게 한다.
- 모델 역공격 성공률을 낮추기 위해 로짓 시프트를 적용하여 멤버십 추론 공격에 대한 기밀성을 강화한다.
- Criteo 및 Avazu 데이터셋에 대해 Adam 최적화기와 학습률 1e-4로 훈련하는 수정된 WDL 모델 아키텍처를 사용한다.
- 서브샘플링된 Criteo(10%)와 전체 Avazu 데이터셋에 대해 90%-10% 훈련-테스트 분할을 수행하며, 배치 크기 8,192, 실험당 3 에포크를 설정한다.
실험 결과
연구 질문
- RQ1모든 조직 간에 공유되는 데이터 엔티티가 무엇인지 파악하지 못하도록 하는 vFL 프레임워크를 설계할 수 있는가?
- RQ2샘플의 유니온만을 사용하여 교차 멤버십를 폭 드러내지 않고도 안전한 데이터 정렬을 달성할 수 있는가?
- RQ3공유되지 않는 샘플에서 기밀성을 보호하면서도 모델 유틸리티를 유지하는 합성 데이터 생성 전략은 무엇인가?
- RQ4기존의 vFL 시스템과 비교해 제안된 프레임워크가 모델 성능을 어느 정도 유지하는가?
- RQ5로짓 시프트 기법이 제안된 프레임워크에서 멤버십 추론 공격을 어느 정도 완화하는가?
주요 결과
- 제안된 PSU 기반 vFL 프레임워크는 모든 당사자가 교차 멤버십를 파악하지 못하도록 성공적으로 방지하여, 모든 당사자에 대해 완전히 기밀성을 보장하는 첫 번째 솔루션이다.
- 멤버십 추론 공격의 AUC가 크게 감소했으며, 특히 로짓 시프트 적용 시 기밀성 침해에 대한 저항력이 높게 나타났다.
- α=0.95일 때 fea-sampling 전략은 기준-부분(partial) 대비 AUC 감소율 6.7%를 기록하여 고도의 데이터 겹침 상황에서도 수용 가능한 유틸리티 손실을 보였다.
- 합성 특징과 레이블을 함께 사용하고 로짓 시프트를 적용할 경우 ACE(공격 신뢰도 추정치)가 크게 감소하여 모델 역공격에 대한 강건성이 향상됨을 보였다.
- α=β=0.05일 때 기준-부분 대비 AUC 감소율은 극히 미미한 −0.066%였으며, α=β=0.95일 때도 −11.71%로 유지되어 유틸리티 유지 능력이 뛰어나다는 것을 입증했다.
- 실제 Criteo 및 Avazu 데이터셋을 대상으로 한 실험을 통해, 안전한 유니온 기반 정렬과 합성 데이터 생성을 통해 기밀성을 확보하면서도 높은 모델 유틸리티를 유지함을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.