Skip to main content
QUICK REVIEW

[논문 리뷰] Adaptive Test-Time Personalization for Federated Learning

Wenxuan Bao, Tianxin Wei|arXiv (Cornell University)|2023. 10. 28.
Privacy-Preserving Technologies in Data인용 수 5
한 줄 요약

이 논문은 레이블이 없는 테스트 데이터가 없는 상황에서 다양한 분포 이탈을 처리하기 위해 소스 클라이언트 데이터로부터 모듈별 적응률을 학습하는 새로운 적응형 테스트 시간 개인화 프레임워크인 ATP를 제안한다. 상호 클라이언트 간 분포 이탈에 기반해 동적으로 적응률을 조정함으로써, 레이블 이탈, 이미지 손상, 도메인 이탈 상황에서 기존 TTA 방법보다 뛰어난 일반화 성능을 달성한다. 여러 데이터셋과 모델에서 검증되었다.

ABSTRACT

Personalized federated learning algorithms have shown promising results in adapting models to various distribution shifts. However, most of these methods require labeled data on testing clients for personalization, which is usually unavailable in real-world scenarios. In this paper, we introduce a novel setting called test-time personalized federated learning (TTPFL), where clients locally adapt a global model in an unsupervised way without relying on any labeled data during test-time. While traditional test-time adaptation (TTA) can be used in this scenario, most of them inherently assume training data come from a single domain, while they come from multiple clients (source domains) with different distributions. Overlooking these domain interrelationships can result in suboptimal generalization. Moreover, most TTA algorithms are designed for a specific kind of distribution shift and lack the flexibility to handle multiple kinds of distribution shifts in FL. In this paper, we find that this lack of flexibility partially results from their pre-defining which modules to adapt in the model. To tackle this challenge, we propose a novel algorithm called ATP to adaptively learns the adaptation rates for each module in the model from distribution shifts among source domains. Theoretical analysis proves the strong generalization of ATP. Extensive experiments demonstrate its superiority in handling various distribution shifts including label shift, image corruptions, and domain shift, outperforming existing TTA methods across multiple datasets and model architectures. Our code is available at https://github.com/baowenxuan/ATP .

연구 동기 및 목표

  • 복잡한 분포 이탈에 직면한 새로운 레이블이 없는 클라이언트를 위한 페더레이티드 학습 모델의 개인화 문제를 해결하기 위해.
  • 단일 도메인 학습을 가정하고 유연성이 떨어지는 기존 테스트 시간 적응(TTA) 방법의 한계를 극복하기 위해.
  • 소스 클라이언트 간 관측된 분포 이탈을 바탕으로 어떤 모델 구성 요소를 적응시킬지 학습함으로써, 모듈에 관계없이 민첩한 적응을 가능하게 하기 위해.
  • 크로스 디바이스 페더레이티드 학습 환경에서 레이블이 없는 개인화를 위한 이론적으로 탄탄하고 강력한 방법을 제공하기 위해.

제안 방법

  • ATP는 소스 클라이언트에서 테스트 시간 개인화를 시뮬레이션하고, 성능을 최대화하기 위해 모듈별 적응률을 최적화함으로써 학습한다.
  • 적응률은 각 모델 모듈(예: 배치 정규화 통계, 가중치) 별로 학습되며, 중앙 집중적으로 집계되어 일반화 성능을 향상시킨다.
  • 추론 단계에서 타겟 클라이언트는 학습된 적응률을 사용하여 레이블이 없는 테스트 데이터만으로 글로벌 모델을 국소적으로 개인화한다.
  • 온라인 적응을 향상시키기 위해 배치 간에 적응된 모델 상태를 누적 평균화한다.
  • 이론적 분석을 통해 ATP는 다중 소스 활용과 저차원 적응률 학습 덕분에 잘 일반화됨을 보여준다.
  • 음수의 적응률을 허용함으로써, 레이블 이탈 상황에서 비직관적이지만 효과적인 '비일치' 상태의 특징을 유도할 수 있다.

실험 결과

연구 질문

  • RQ1페더레이티드 학습에서 레이블이 없는 테스트 데이터에 의존하지 않고도 모듈별 효과적인 유연한 적응률을 학습할 수 있는가?
  • RQ2소스 도메인 간 상호 클라이언트 분포 이탈을 어떻게 활용하여 테스트 시간 페더레이티드 학습에서 레이블이 없는 개인화를 이끌 수 있는가?
  • RQ3적응형 모듈별 적응이 다양한 분포 이탈 상황에서 고정 모듈 TTA 방법보다 우수한 성능을 내는가?
  • RQ4음수의 적응률은 레이블 이탈 상황에서 성능 향상에 기여하는가? 만약 그렇다면 그 이유는 무엇인가?

주요 결과

  • ATP는 CIFAR-10, CIFAR-100, Tiny ImageNet 등의 여러 데이터셋과 ResNet, Vision Transformer 등의 다양한 모델 아키텍처에서 기존 TTA 방법보다 일관되게 뛰어난 성능을 보였다.
  • 레이블 이탈 상황에서 ATP는 배치 정규화의 누적 통계에 대해 음수의 적응률을 학습하며, 비직관적으로 특징을 '비일치'시킴으로써 정확도를 향상시켰다.
  • 실험 결과, ATP는 부분적 클라이언트 참여(최소 C=15) 상황에서도 안정적인 수렴과 낮은 테스트 손실을 보이며 강건한 일반화 성능를 확보했다.
  • 완전한 참여와 부분적 참여 상황에서 훈련 손실과 테스트 손실 곡선이 안정적으로 수렴하여 강력한 일반화와 내구성을 보였다.
  • 간단한 예제에서 ATP는 α = -0.5일 때 레이블 이탈 상황에서 92%의 정확도를 달성했으며, α = 0(89%) 및 α = 1(73%)보다 뛰어난 성능을 보였다. 이는 음수 적응률의 유용성을 검증한다.
  • ATP의 이론적 분석은 다수의 소스 도메인 활용과 저차원 적응률 학습 덕분에 강력한 일반화 성능를 확보함을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.