Skip to main content
QUICK REVIEW

[논문 리뷰] Fair and efficient contribution valuation for vertical federated learning

Zhenan Fan, Fang Huang|arXiv (Cornell University)|2022. 01. 07.
Privacy-Preserving Technologies in Data인용 수 15
한 줄 요약

이 논문은 수직 분산 학습(VFL)을 위한 공정하고 효율적인 기여 평가 방법인 수직 분산 샤플리 값(VerFedSV)을 제안한다. VerFedSV는 전체 모델 재학습 없이도 클라이언트의 기여도를 계산할 수 있으며, 다양한 학습 타임스탬프에서의 클라이언트 임bedding과 행렬 완성 기법을 활용하여 핵심 공정성 축약 조건을 만족하고, 동기 및 이방형 VFL 모두에 적응 가능하다. 이로 인해 높은 효율성과 데이터 품질 및 통신 빈도를 반영한 정확한 보상 배분이 가능하다.

ABSTRACT

Federated learning is an emerging technology for training machine learning models across decentralized data sources without sharing data. Vertical federated learning, also known as feature-based federated learning, applies to scenarios where data sources have the same sample IDs but different feature sets. To ensure fairness among data owners, it is critical to objectively assess the contributions from different data sources and compensate the corresponding data owners accordingly. The Shapley value is a provably fair contribution valuation metric originating from cooperative game theory. However, its straight-forward computation requires extensively retraining a model on each potential combination of data sources, leading to prohibitively high communication and computation overheads due to multiple rounds of federated learning. To tackle this challenge, we propose a contribution valuation metric called vertical federated Shapley value (VerFedSV) based on the classic Shapley value. We show that VerFedSV not only satisfies many desirable properties of fairness but is also efficient to compute. Moreover, VerFedSV can be adapted to both synchronous and asynchronous vertical federated learning algorithms. Both theoretical analysis and extensive experimental results demonstrate the fairness, efficiency, adaptability, and effectiveness of VerFedSV.

연구 동기 및 목표

  • 수직 분산 학습(VFL)에서 데이터 소유자가 공유 샘플에 대해 서로 다른 특징을 기여하는 상황에서 공정하고 효율적인 기여 평가의 과제를 해결하기 위해.
  • VFL에서 정확한 샤플리 값 계산이 모든 클라이언트 부분집합에 대해 재학습이 필요하기 때문에 발생하는 금방이 큰 계산 비용을 해결하기 위해.
  • 확장성이 뛰어나 실제 VFL 시스템에 적용 가능한 실현 가능성을 확보하면서도, 샤플리 값의 공정성 성질(대칭성, 가환성, 영 원소, 균형)을 유지하는 방법을 설계하기 위해.
  • 동기 및 이방형 VFL 학습 프로토콜 모두에 적응 가능하게 하여 데이터 품질과 클라이언트의 계산 노력 모두를 반영하기 위해.
  • VerFedSV가 더 높은 품질의 데이터를 가진 클라이언트와 더 활발한 참여를 보이는 클라이언트에게 더 높은 평가를 정확히 부여함을 경험적으로 검증하기 위해.

제안 방법

  • 클라이언트 임bedding을 사용하여 다양한 학습 타임스탬프에서의 마진 기여도를 계산함으로써 VFL에 적합하게 조정된 샤플리 값 기반의 새로운 기여 평가 지표인 VerFedSV를 제안한다.
  • 동기 VFL 환경에서 클라이언트 부분집합의 전역 모델 성능을 효율적으로 추정하기 위해 행렬 완성 기법을 활용하여 전체 재학습을 피한다.
  • 타임스탬프가 부여된 클라이언트 임bedding을 활용하여 모든 가능한 클라이언트 협동 집합에서 각 클라이언트의 기여도를 근사한다.
  • 학습 중에 점진적으로 기여도를 계산하는 동적 평가 프레임워크를 설계하여 통신 및 계산 오버헤드를 감소시킨다.
  • 비동기 설정에서는 데이터 관련성 외에도 통신 빈도를 계산 노력의 대체 지표로 반영하여 적용한다.
  • 각 평가 타임스탬프에서 각 클라이언트의 점진적 기여도를 조합하여 VerFedSV를 효율적으로 계산하기 위해 재귀적 집계 방식을 적용한다.

실험 결과

연구 질문

  • RQ1전체 모델 재학습 없이도 VFL 환경에서 샤플리 값 기반 기여 평가 지표를 효율적으로 계산할 수 있는가?
  • RQ2제안된 방법이 VFL 환경에서 공정성 축약 조건(대칭성, 가환성, 영 원소, 균형)을 유지하는가?
  • RQ3비동기 VFL 환경에서 VerFedSV는 데이터 품질과 통신 빈도의 차이를 어떻게 반영하는가?
  • RQ4VerFedSV는 동기 및 이방형 VFL 학습 프로토콜 모두에서 효율적으로 계산될 수 있는가?
  • RQ5VerFedSV는 더 높은 품질의 데이터를 가진 클라이언트와 더 활발한 참여를 보이는 클라이언트에게 얼마나 더 높은 평가를 부여하는가?

주요 결과

  • VerFedSV는 이론적으로 증명된 정리 1에 따라 샤플리 값의 네 가지 공정성 축약 조건—대칭성, 가환성, 영 원소, 균형—을 모두 만족한다.
  • 실험 결과, 무작위로 생성된 특징을 가진 클라이언트가 모든 데이터셋에서 총 VerFedSV의 0.4% 미만을 기여함을 확인하여, 유의미한 데이터만 기여도에 영향을 준다는 것을 입증한다.
  • 더 높은 통신 빈도를 가진 클라이언트는 비례적으로 더 높은 VerFedSV를 기록한다. 예를 들어, Adult 데이터셋에서 동일한 특징을 가진 인공 클라이언트 중 가장 높은 빈도의 클라이언트는 기여도의 93%를 차지했다.
  • 비동기 설정에서는 VerFedSV가 클라이언트의 계산 노력까지 정확히 반영하며, 데이터 품질이 동일한 경우에도 통신 빈도가 증가함에 따라 기여도가 선형적으로 증가함을 확인했다.
  • Adult 데이터셋에서 정규 클라이언트가 총 VerFedSV의 97.91%를 기여했고, 무작위 특징을 가진 인공 클라이언트는 단지 2.09%에 그쳤다. 이는 데이터 품질에 민감함을 보여준다.
  • VerFedSV는 전체 모델 재학습 없이도 효율적인 기여 평가를 가능하게 하여, 높은 통신 및 계산 비용이 수반되는 대규모 VFL 시스템에 실용적으로 적용 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.