[논문 리뷰] New Metrics to Evaluate the Performance and Fairness of Personalized Federated Learning
이 논문은 평균 정확도를 넘어서 개인화된 피어드 페더레이티드 러닝(FL) 방법을 평가하기 위한 종합적인 성능 및 공정성 메트릭스를 소개한다. 평균 정확도가 가장 높은 모델이 반드시 공정성 면에서 뛰어나지 않음을 입증하며, CIFAR-10의 세 가지 비IIDs 데이터 분할에서 네 가지 방법을 사용해 사용자별 성능과 공정한 향상 간의 상충 관계를 드러낸다.
In Federated Learning (FL), the clients learn a single global model (FedAvg) through a central aggregator. In this setting, the non-IID distribution of the data across clients restricts the global FL model from delivering good performance on the local data of each client. Personalized FL aims to address this problem by finding a personalized model for each client. Recent works widely report the average personalized model accuracy on a particular data split of a dataset to evaluate the effectiveness of their methods. However, considering the multitude of personalization approaches proposed, it is critical to study the per-user personalized accuracy and the accuracy improvements among users with an equitable notion of fairness. To address these issues, we present a set of performance and fairness metrics intending to assess the quality of personalized FL methods. We apply these metrics to four recently proposed personalized FL methods, PersFL, FedPer, pFedMe, and Per-FedAvg, on three different data splits of the CIFAR-10 dataset. Our evaluations show that the personalized model with the highest average accuracy across users may not necessarily be the fairest. Our code is available at https://tinyurl.com/1hp9ywfa for public use.
연구 동기 및 목표
- 사용자 수준의 성능과 공정성을 모두 고려하는 개인화된 피어드 페더레이티드 러닝(FL) 방법에 대한 표준화된 평가 부족 문제를 해결한다.
- 기존 연구들이 평균 정확도에 크게 의존하고 있으며, 이는 사용자 수준의 성능 격차를 가리고 공정한 향상도 忽视한다는 점을 지적한다.
- 성능과 공정성을 정량적으로 평가할 수 있는 통합된 메트릭스 프레임워크를 제안하여 다양한 방법 간의 공정한 비교를 가능하게 한다.
- CIFAR-10의 세 가지 비IIDs 데이터 분할에서 최근의 네 가지 개인화된 FL 방법을 평가하여 평균 정확도와 공정성 간의 상충 관계를 규명한다.
제안 방법
- 사용자 수준 정확도 향상을 평가하기 위해 평균 정확도(avg-acc), 개인화된 사용자 향상(PUI), 모델 성능 향상(MPI), 평균 성능 향상(API)의 다섯 가지 성능 메트릭스를 도입한다.
- 사용자 간 성능 향상의 공정성을 측정하기 위해 평균 값(AV), 집중도 점수(CS), 엔트로피, 재작도 지수(JI)의 네 가지 공정성 메트릭스를 개발한다.
- CIFAR-10의 세 가지 비IIDs 데이터 분할(DS-1, DS-2, DS-3)에서 PersFL, FedPer, pFedMe, Per-FedAvg의 네 가지 개인화된 FL 방법에 메트릭스를 적용한다.
- 사용자 수준의 향상 품질(QoI)을 메트릭스로 활용하여 분포 기반의 공정성 분석을 수행하며, 밀도도표를 통해 사용자 간 QoI 집중도를 시각화한다.
- 통계 분석 및 시각화(밀도도표, 공정성 메트릭스 추세)를 활용해 다양한 방법과 데이터 분할 간의 공정성 및 성능 상충 관계를 비교한다.
- 공개 사용 및 평가를 위해 코드를 https://tinyurl.com/1hp9ywfa 에 배포하여 재현 가능성을 확보한다.
실험 결과
연구 질문
- RQ1비IIDs 데이터 분할에서 다양한 개인화된 FL 방법의 사용자 수준 정확도 향상은 어떻게 달라지나?
- RQ2사용자 간 평균 정확도가 가장 높은 경우, 사용자 간 공정한 성능 향상 정도는 어느 정도인가?
- RQ3어느 개인화된 FL 방법이 높은 평균 성능와 사용자 간 향상의 공정한 분포 사이에서 가장 균형 잡힌 성능을 보이는가?
- RQ4AV, CS, 엔트로피, JI 등의 공정성 메트릭스는 사용자 간 공정한 성능 향상을 얼마나 잘 반영하는가?
- RQ5데이터 분할 전략의 선택이 공정성 및 성능 측면에서 개인화된 FL 방법의 상대 순위에 유의미한 영향을 미치는가?
주요 결과
- DS-3에서 PersFL은 가장 높은 평균 정확도(82.29%)를 기록했지만, 여러 공정성 메트릭스 기준으로 가장 공정한 방법은 아니었다.
- DS-2에서 pFedMe는 가장 낮은 평균 값(AV)을 기록했고, CS, 엔트로피, JI 값이 가장 높아, PersFL과 유사한 성능에도 불구하고 가장 공정한 방법으로 나타났다.
- DS-1에서 PersFL은 가장 높은 QoI 집중도와 가장 우수한 공정성 점수(CS, 엔트로피, JI)를 기록하여 해당 분할에서 가장 공정한 방법이었다.
- FedPer는 DS-3에서 가장 낮은 AV를 기록했지만, 다른 공정성 메트릭스에서는 열악한 성능을 보여, 사용자 수준의 향상이 균일하지 않았음을 시사했다.
- 가장 높은 평균 정확도를 기록한 모델(PersFL, DS-3)이 항상 가장 공정한 순위에 오르지 않음을 확인하여, 평균 성능와 공정성 간의 명확한 상충 관계를 입증했다.
- 공정성 메트릭스는 평균 정확도가 높더라도 일부 사용자는 성능 향상이 거의 없거나 전혀 없을 수 있음을 드러내며, 평균 정확도를 넘어서는 공정한 평가의 필요성을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.