Skip to main content
QUICK REVIEW

[논문 리뷰] GTG-Shapley: Efficient and Accurate Participant Contribution Evaluation in Federated Learning

Zelei Liu, Yuanyuan Chen|arXiv (Cornell University)|2021. 09. 05.
Privacy-Preserving Technologies in Data인용 수 9
한 줄 요약

GTG-Shapley는 재학습 없이 Shapley 값으로 참가자 기여도를 평가하는 효율적이고 정확한 방법을 제안한다. 기울기 업데이트를 활용해 부분 모델을 재구성하고, 라운드 내외에서 잘라내는 전략과 함께 지도형 몬테카를로 샘플링을 적용하여 계산량을 극적으로 감소시키면서도 높은 정확도를 유지한다. 특히 비i.i.d. 데이터 분포 상황에서 뛰어난 성능을 발휘한다.

ABSTRACT

Federated Learning (FL) bridges the gap between collaborative machine learning and preserving data privacy. To sustain the long-term operation of an FL ecosystem, it is important to attract high quality data owners with appropriate incentive schemes. As an important building block of such incentive schemes, it is essential to fairly evaluate participants' contribution to the performance of the final FL model without exposing their private data. Shapley Value (SV)-based techniques have been widely adopted to provide fair evaluation of FL participant contributions. However, existing approaches incur significant computation costs, making them difficult to apply in practice. In this paper, we propose the Guided Truncation Gradient Shapley (GTG-Shapley) approach to address this challenge. It reconstructs FL models from gradient updates for SV calculation instead of repeatedly training with different combinations of FL participants. In addition, we design a guided Monte Carlo sampling approach combined with within-round and between-round truncation to further reduce the number of model reconstructions and evaluations required, through extensive experiments under diverse realistic data distribution settings. The results demonstrate that GTG-Shapley can closely approximate actual Shapley values, while significantly increasing computational efficiency compared to the state of the art, especially under non-i.i.d. settings.

연구 동기 및 목표

  • 연합 학습에서 기존 Shapley 값 기반 기여도 평가 방법의 높은 계산 비용 문제를 해결하기 위해.
  • 로컬 데이터 폭 lộ 없이 공정하고 프라이버시를 보장하는 참가자 기여도 평가를 가능하게 하기 위해.
  • 정확한 Shapley 값 근사치를 도출하기 위해 필요한 모델 재구성 및 평가 횟수를 줄이기 위해.
  • 랜덤 순열 샘플링에서 발생하는 편향을 제거하기 위해 지도형 샘플링을 도입하여 몬테카를로 추정의 편향을 줄이기 위해.
  • 라운드 내외에서 잘라내는 전략을 통해 효율성과 정확성을 동시에 향상시키기 위해.

제안 방법

  • 모델를 다시 학습하는 대신 기울기 업데이트로부터 부분 모델을 재구성하여 불필요한 학습을 방지한다.
  • 각 참가자가 핵심 위치에 올라갈 가능성이 높은 순열을 우선적으로 선택하는 지도형 몬테카를로 샘플링 전략을 적용하여 추정 편향을 감소시킨다.
  • 단일 라운드 샘플링 중 불필요한 부분 모델 평가를 생략하기 위해 라운드 내 잘라내기 전략을 적용한다.
  • 여러 라운드에 걸쳐 모델 유틸리티 향상 폭이 정체될 경우 조기에 종료하기 위해 라운드 간 잘라내기 전략을 도입한다.
  • 이미 평가된 모델 유틸리티를 기반으로 부분 모델 재구성 및 평가 작업을 유기적으로 생략한다.
  • 기울기 기반 모델 재구성과 잘라내기 기법을 결합하여 높은 효율성과 정확도를 달성한다.

실험 결과

연구 질문

  • RQ1기울기 기반 부분 모델 재구성 기법이 연합 학습에서 Shapley 값 추정의 계산 비용을 크게 줄일 수 있는가?
  • RQ2랜덤 순열 샘플링에 비해 지도형 샘플링이 편향 감소와 정확도 향상에 얼마나 효과적인가?
  • RQ3라운드 내외에서 잘라내기 전략이 정확도를 희생시키지 않고 효율성을 얼마나 향상시킬 수 있는가?
  • RQ4비i.i.i.d. 데이터 분포 상황에서 GTG-Shapley는 어떻게 성능을 발휘하는가? (실제 연합 학습 환경에서 흔한 상황)
  • RQ5제안된 방법은 정확도와 효율성을 동시에 높일 수 있으며, 최신 기술 대비 뛰어난 성능을 발휘하는가?

주요 결과

  • GTG-Shapley는 지표로 사용된 진정한 Shapley 값에 매우 가까운 근사치를 도출하였으며, 모든 테스트 환경에서 최신 기술 대비 일관되게 높은 정확도를 확보하였다.
  • 특히 비i.i.d. 데이터 분포 상황에서 기존 방법 대비 계산 시간을 수개월 정도로 감소시켰다.
  • 라운드 간 잘라내기 전략은 평균 17%의 효율성 향상을 가져왔으며, 일부 설정에선 최대 3배 빠른 속도로 성능 향상을 기록했다. 정확도는 손상되지 않았다.
  • 지도형 샘플링은 정확도 향상에 뚜렷한 기여를 하였으며, 대부분의 경우 랜덤 샘플링 대비 수개월 정도 뛰어난 성능을 기록하였다.
  • 라운드 내 잘라내기 전략은 단일 라운드 내 불필요한 평가를 줄여 전체적인 효율성 향상에 기여하였다.
  • GTG-Shapley는 모든 기준선 대비 효율성과 정확도에서 뛰어난 성능을 보였으며, 특히 공정성과 정확도가 가장 중요한 비i.i.d. 환경에서 두각을 나타냈다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.