Skip to main content
QUICK REVIEW

[논문 리뷰] FedTune: A Deep Dive into Efficient Federated Fine-Tuning with Pre-trained Transformers

Jinyu Chen, Wenchao Xu|arXiv (Cornell University)|2022. 11. 15.
Privacy-Preserving Technologies in Data인용 수 8
한 줄 요약

이 논문은 FL 환경에서 사전 훈련된 비전 및 비전-언어 트랜스포머 모델을 위한 파rameter 효율적인 피드포워드 미세조정 프레임워크인 FedTune을 제안한다. 실험 결과, CLIP 모델에 대한 바이어스 튜닝이 가장 높은 정확도(일관된 데이터 분포에서는 95% 이상, 비일관된 데이터 분포에서는 92% 이상)를 달성하며, 수렴 속도가 빠르고 통신 비용을 줄일 수 있음을 입증하였으며, 기존의 전통적인 CNN 및 다른 튜닝 방법보다 FL 환경에서 뛰어난 성능을 보였다.

ABSTRACT

Federated Learning (FL) is an emerging paradigm that enables distributed users to collaboratively and iteratively train machine learning models without sharing their private data. Motivated by the effectiveness and robustness of self-attention-based architectures, researchers are turning to using pre-trained Transformers (i.e., foundation models) instead of traditional convolutional neural networks in FL to leverage their excellent transfer learning capabilities. Despite recent progress, how pre-trained Transformer models play a role in FL remains obscure, that is, how to efficiently fine-tune these pre-trained models in FL and how FL users could benefit from this new paradigm. In this paper, we explore this issue and demonstrate that the fine-tuned Transformers achieve extraordinary performance on FL, and that the lightweight fine-tuning method facilitates a fast convergence rate and low communication costs. Concretely, we conduct a rigorous empirical study of three tuning methods (i.e., modifying the input, adding extra modules, and adjusting the backbone) using two types of pre-trained models (i.e., vision-language models and vision models) for FL. Our experiments show that 1) Fine-tuning the bias term of the backbone performs best when relying on a strong pre-trained model; 2) The vision-language model (e.g., CLIP) outperforms the pure vision model (e.g., ViT) and is more robust to the few-shot settings; 3) Compared to pure local training, FL with pre-trained models has a higher accuracy because it alleviates the problem of over-fitting. We will release our code and encourage further exploration of pre-trained Transformers and FL.

연구 동기 및 목표

  • 사전 훈련된 트랜스포머 모델이 피드포워드 학습 환경에서 어떻게 효율적으로 미세조정될 수 있는지 탐구하여 모델 성능을 향상시키고 자원 소비를 줄이는 것.
  • 비전 및 비전-언어 모델에서 피드포워드 학습 환경에서 다양한 파rameter 효율적인 튜닝 방법(입력 수정, 모듈 추가, 백본 조정)의 효과를 평가하는 것.
  • 기초 모델을 사용한 피드포워드 학습이 순수 지역 학습보다 우수한 성능을 내는지, 특히 비일관된 데이터 분포 조건에서 그러한가를 판단하는 것.
  • 튜닝 방법의 통신 효율성과 모델 크기를 측정하여 자원 제약이 있는 기기에서의 구현 가능성을 평가하는 것.

제안 방법

  • 프레임워크는 사전 훈련된 비전(ViT) 및 비전-언어(CLIP) 모델에 대해 프롬프트 튜닝(입력 수정), 어댑터 튜닝(추가 모듈), 바이어스 튜닝(백본 조정)의 세 가지 튜닝 방법을 적용한다.
  • 피드포워드 학습은 글로벌 모델 집합 전략을 사용하는 FedAvg를 통해 수행되며, 클라이언트는 지역적으로 훈련하고 서버에 기울기 정보를 업로드한다.
  • 수렴 조건은 99%의 정확도에 도달하거나 라운드 간 훈련 정확도 차이가 0.5% 미만이 되는 것으로 정의된다.
  • 통신 비용은 $ c = r \times n \times s \times 2 $ 로 계산되며, 여기서 $ r $ 은 라운드 수, $ n $ 은 클라이언트 수, $ s $ 는 모델 크기이다.
  • 연구는 다양한 설정에서 성능을 평가한다: 일관된 데이터 대비 비일관된 데이터, 소수의 샘플(1~16샷), 다양한 클라이언트 수(10~100명).
  • 분포 이탈 조건에서 개인화 효과를 평가하기 위해 프레임워크는 Per-FedAvg로 확장된다.

실험 결과

연구 질문

  • RQ1피드포워드 학습 환경에서 사전 훈련된 트랜스포머를 미세조정할 때 프롬프트, 어댑터, 바이어스 튜닝 중 어떤 파rameter 효율적인 튜닝 방법이 가장 높은 성능을 내는가?
  • RQ2소수의 샘플이나 비일관된 데이터 분포 조건에서 비전-언어 모델(CLIP 등)과 순수 비전 모델(ViT 등) 간 정확도와 강건성 측면에서의 성능 비교는 어떠한가?
  • RQ3특히 자료가 부족하거나 비일관된 데이터 분포 조건에서, 사전 훈련된 모델을 사용한 피드포워드 미세조정이 순수 지역 학습보다 성능이 뛰어나게 되는가?
  • RQ4통신 비용과 모델 크기 측면에서 튜닝 방법의 효율성은 어떠하며, 엣지 기기에서의 구현이 가능한가?
  • RQ5사전 훈련된 모델과 효율적인 튜닝을 조합할 때, 개인화 가능한 피드포워드 학습 방법인 Per-FedAvg가 성능 향상에 기여하는가?

주요 결과

  • CLIP 모델에 대한 바이어스 튜닝이 가장 높은 정확도를 기록하였으며, 일관된 데이터 분포에서는 95% 이상, 비일관된 데이터 분포에서는 92% 이상의 성능을 달성하여 모든 다른 튜닝 방법을 능가하였다.
  • CLIP 모델은 소수의 샘플 조건에서도 항상 ViT 모델보다 뛰어나며, 자료 부족과 분포 이탈에 대해 더 강건한 성능을 보였다.
  • CLIP 프롬프트 튜닝의 통신 비용은 16샷 학습에서 단 1.038MB로 매우 낮았으며, 모든 방법이 15라운드 이내에 수렴하였다.
  • 튜닝 파ram터는 경량이었으며, CLIP 프롬프트는 단 17.3KB, CLIP 바이어스는 459.7KB에 불과하여 엣지 기기 배포에 적합하였다.
  • 16샷 비일관된 데이터 분포에서 CLIP 바이어스를 사용할 경우 Per-FedAvg는 FedAvg 대비 6.7% 성능 향상을 보였으며, ViT 바이어스를 사용할 경우 1샷 학습에서 32.65% 향상되었다.
  • 기초 모델을 사용한 피드포워드 학습은 과적합을 줄이고 순수 지역 학습보다 더 높은 정확도를 달성하였으며, 특히 비일관된 데이터 분포 조건에서 두드러진 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.