[논문 리뷰] A Principled Approach to Data Valuation for Federated Learning
이 논문은 연합 학습을 위한 통신 효율적이고 순서를 고려한 Shapley 값의 변종인 연합 Shapley 값(federated Shapley value)을 제안한다. 이는 추가적인 통신 없이 국소 모델 업데이트에서 기여도를 계산함으로써 공정한 데이터 평가를 가능하게 하며, 백도어 탐지, 노이즈 있는 레이블 식별, 효율적 훈련을 위한 데이터 요약 등에서 기존 기준보다 뛰어난 성능을 보인다.
Federated learning (FL) is a popular technique to train machine learning (ML) models on decentralized data sources. In order to sustain long-term participation of data owners, it is important to fairly appraise each data source and compensate data owners for their contribution to the training process. The Shapley value (SV) defines a unique payoff scheme that satisfies many desiderata for a data value notion. It has been increasingly used for valuing training data in centralized learning. However, computing the SV requires exhaustively evaluating the model performance on every subset of data sources, which incurs prohibitive communication cost in the federated setting. Besides, the canonical SV ignores the order of data sources during training, which conflicts with the sequential nature of FL. This paper proposes a variant of the SV amenable to FL, which we call the federated Shapley value. The federated SV preserves the desirable properties of the canonical SV while it can be calculated without incurring extra communication cost and is also able to capture the effect of participation order on data value. We conduct a thorough empirical study of the federated SV on a range of tasks, including noisy label detection, adversarial participant detection, and data summarization on different benchmark datasets, and demonstrate that it can reflect the real utility of data sources for FL and has the potential to enhance system robustness, security, and efficiency. We also report and analyze "failure cases" and hope to stimulate future research.
연구 동기 및 목표
- 참여 순서를 고려한 원칙적이고 통신 효율적인 연합 학습을 위한 데이터 평가 방법이 부족한 점을 해결하기 위해.
- 공정성과 바람직한 축약 성질을 지닌 것으로 알려진 Shapley 값을 분산형이고 순차적인 FL의 특성에 맞게 적응시키기 위해.
- 기본 훈련 외에 추가적인 통신 비용을 부담하지 않고도 실용적인 연합 학습에서의 데이터 평가를 가능하게 하기 위해.
- 백도어 탐지, 노이즈 있는 레이블 식별, 데이터 요약과 같은 실제 작업에서 연합 SV의 유용성을 평가하기 위해.
- 미래의 연합 학습에서의 데이터 평가 연구를 안내하기 위해 한계점과 실패 케이스를 규명하기 위해.
제안 방법
- 연합 학습에서 참가자의 기여 순서를 고려하는 기존 Shapley 값의 변종으로서 연합 Shapley 값을 제안한다.
- 각 훈련 라운드에서의 국소 모델 업데이트를 사용하여 추가 통신 없이도 연합 Shapley 값을 계산한다.
- 대규모 연합 학습에서 계산 비용을 크게 줄이기 위해 효율적인 몬테카를로 근사 방법을 적용한다.
- 각 참가자가 업데이트한 후 글로벌 모델의 성능 향상을 통해 기여도의 경계 기여도를 참가자의 기여 순서에 따라 추정한다.
- 비IIDs 환경에서 데이터 가치 분포가 비대칭일 경우의 강건성을 향상시키기 위해 정규화 기법을 적용한다.
- 제어된 데이터 훼손 및 선택 전략을 사용하여 여러 작업에서 실세계 벤치마크 데이터셋(MNIST, CIFAR-10)을 활용해 방법을 검증한다.
실험 결과
연구 질문
- RQ1연합 학습을 위한 원칙적 데이터 평가 방법을 설계할 수 있는가? 이는 데이터 기여의 순서를 고려해야 한다.
- RQ2추가적인 통신 비용 없이 Shapley 값을 연합 학습에 적응시킬 수 있는가?
- RQ3연합 Shapley 값은 백도어 및 노이즈 있는 레이블 식별에서 실제 데이터 원천의 기여도를 얼마나 잘 반영하는가?
- RQ4랜덤 또는 LOO 기반 선택과 비교해, 연합 SV를 사용한 데이터 요약이 훈련 효율성과 모델 정확도를 향상시키는가?
- RQ5비IIDs 또는 극도로 비대칭적인 데이터 설정에서 연합 Shapley 값의 한계점과 실패 케이스는 무엇인가?
주요 결과
- 비IIDs 환경에서 연합 Shapley 값은 연합 LOO보다 백도어 탐지 성능에서 뛰어나며, 정규화된 형태는 성공률이 크게 향상된다.
- MNIST(IID)에서 연합 SV 기반의 데이터 요약은 랜덤 및 LOO 기준보다 더 높은 테스트 정확도를 달성하여 모델 효율성의 효과를 입증한다.
- 비IIDs 환경에서는 자주 선택된 참가자에게 편향이 발생하여, 저도입률일 경우 LOO보다 성능이 떨어지는 경향을 보였다.
- CIFAR-10에서는 MNIST보다 연합 Shapley 값의 성능이 열 劣하였는데, 이는 데이터셋 내 재현성이 낮아 중요한 참가자의 손실이 더 큰 영향을 미치기 때문일 것이다.
- 비IIDs 환경에서 선택 빈도가 낮은 참가자들은 연합 Shapley 값이 음수를 받는 경향이 있었으며, 이는 가치 추정에 잠재적 편향이 있음을 시사한다.
- 연구는 비IIDs 상황에서의 비대칭 가치 분포와 같은 주요 실패 케이스를 규명하였으며, 향후 강건한 정규화 및 추정 기법 개발이 필요하다고 제안한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.