[논문 리뷰] Game of Privacy: Towards Better Federated Platform Collaboration under Privacy Restriction
이 논문은 개인정보 보호 제약 조건 하에서 수직 분산 학습에서 상호 협력하기 위한 게임 이론적 프레임워크인 FedGame을 제안한다. 플랫폼들은 '예치' 데이터를 통해 상호 플랫폼 간 데이터 가치를 추정하고 기울기 기반 정책 최적화를 통해 협상함으로써 제한된 데이터 할당량을 전략적으로 배분하여 모델 성능을 극대화한다. 중앙 집중적 신뢰가 필요 없이 효과적인 다중 플랫폼 협업을 달성한다.
Vertical federated learning (VFL) aims to train models from cross-silo data with different feature spaces stored on different platforms. Existing VFL methods usually assume all data on each platform can be used for model training. However, due to the intrinsic privacy risks of federated learning, the total amount of involved data may be constrained. In addition, existing VFL studies usually assume only one platform has task labels and can benefit from the collaboration, making it difficult to attract other platforms to join in the collaborative learning. In this paper, we study the platform collaboration problem in VFL under privacy constraint. We propose to incent different platforms through a reciprocal collaboration, where all platforms can exploit multi-platform information in the VFL framework to benefit their own tasks. With limited privacy budgets, each platform needs to wisely allocate its data quotas for collaboration with other platforms. Thereby, they naturally form a multi-party game. There are two core problems in this game, i.e., how to appraise other platforms' data value to compute game rewards and how to optimize policies to solve the game. To evaluate the contributions of other platforms' data, each platform offers a small amount of "deposit" data to participate in the VFL. We propose a performance estimation method to predict the expected model performance when involving different amount combinations of inter-platform data. To solve the game, we propose a platform negotiation method that simulates the bargaining among platforms and locally optimizes their policies via gradient descent. Extensive experiments on two real-world datasets show that our approach can effectively facilitate the collaborative exploitation of multi-platform data in VFL under privacy restrictions.
연구 동기 및 목표
- 수직 분산 학습(VFL)에서 레이블 보유 플랫폼만 이득을 보는 데서 비롯되는 인cent라이브의 부족을 해결하기 위해.
- 개인정보 예산 제약 조건 하에서 상호 데이터 공유를 통한 플랫폼 협업을 다자 게임으로 모델링하기 위해.
- 각 플랫폼이 제한된 데이터 할당량을 전략적으로 배분하여 개별 모델 성능 향상을 극대화하기 위해.
- 수익 배분에 중앙 기관에 의존하지 않는 신뢰 없는 분산 메커니즘을 설계하기 위해.
- 실제 개인정보 제약 조건 하에서 교차 플랫폼 데이터 가치를 추정하고 협업 정책을 최적화하는 확장 가능한 방법을 개발하기 위해.
제안 방법
- 각 플랫폼은 상호 플랫폼 간 VFL 학습에 참여하기 위해 소량의 '예치' 데이터를 기여함으로써, 전체 데이터 공유 없이도 성능 추정이 가능하도록 한다.
- 다변수 회귀 모델이 다양한 양의 상호 플랫폼 예치 데이터 기반으로 예상되는 모델 성능 향상을 추정한다.
- 플랫폼들은 기울기 강하를 통해 협상 정책을 최적화하는 방식으로 실제 상황과 유사한 낙관적 협상 과정을 시뮬레이션한다.
- 게임 해결 프레임워크는 성능 추정을 통해 보상을 계산하고 나슈 균형에 도달하도록 정책 업데이트를 이끈다.
- 협업 정책은 추정된 성과 향상 기반으로 국지적으로 최적화되어 분산된, 인cent라이브가 일치하는 의사결정을 가능하게 한다.
- 정책 수렴 후 최종 모델이 학습되어, 플랫폼 간 개인정보 제약 조건 하에서 효과적인 데이터 활용이 보장된다.
실험 결과
연구 질문
- RQ1레이블 보유 플랫폼 외의 플랫폼들이 기여할 동기를 어떻게 부여할 수 있는가? (기존에는 레이블 보유 플랫폼만 이득을 보는 구조에서)
- RQ2전체 데이터 공유 없이 개인정보 제약 조건 하에서 상호 플랫폼 간 데이터 가치를 정확히 어떻게 추정할 수 있는가?
- RQ3제한된 데이터 예산을 가진 다수의 플랫폼 간에서 안정적이고 효과적인 협업을 가능하게 하는 협상 메커니즘은 무엇인가?
- RQ4예치 데이터 크기의 선택이 성능 추정 정확도와 최종 모델 성능에 어떤 영향을 미치는가?
- RQ5상호 협업 기반 VFL에서 데이터 기여와 개인정보 예산 사용 간의 최적 균형은 무엇인가?
주요 결과
- FedGame는 모든 플랫폼이 협업에서 이득을 보게 하여, 아무도 데이터를 기여하지 않는 '구금의 딜레마' 상황을 피한다.
- Adult 및 CTR 데이터셋에서 플랫폼들은 보완적인 특징을 지닌 플랫폼, 예를 들어 첫 번째 플랫폼이 세 번째 플랫폼과 협업을 우선적으로 선택하는 등 전략적으로 데이터를 배분한다.
- 협상 매개변수 γ를 2.5로 설정할 경우 최적의 평균 모델 성능을 달성하며, 협력과 경쟁의 균형을 잘 유지한다.
- 전체 데이터의 5%를 예치 데이터로 사용할 경우 추정 정확도와 개인정보 예산 소비 간 최적의 트레이드오프를 달성한다.
- 매우 작은 예치 데이터 세트에서는 데이터가 부족하여 성능 예측 오차가 높고, 큰 예치 데이터는 개인정보 예산 과다 소비로 인해 성능이 저하된다.
- 플랫폼 협상 메커니즘은 이타적 행동을 방지하고 모든 플랫폼 간 균형 잡힌 상호 유익 협업을 유지한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.