Skip to main content
QUICK REVIEW

[논문 리뷰] lo-fi: distributed fine-tuning without communication

Mitchell Wortsman, Suchin Gururangan|arXiv (Cornell University)|2022. 10. 19.
Advanced Neural Network Applications인용 수 7
한 줄 요약

이 논문은 훈련 중 노드 간 통신이 전혀 필요 없이 대규모 신경망을 분산 미세조정하는 방법인 lo-fi를 제안한다. 각 노드는 자체 데이터 파artition에서 독립적으로 모델을 미세조정하고, 훈련 후 최종 모델은 가중치를 평균하여 구성된다. lo-fi는 ImageNet 및 분포 이탈 벤치마크에서 베이스라인 성능을 유지하거나 초월하며, 통신 오버헤드를 제거한다.

ABSTRACT

When fine-tuning large neural networks, it is common to use multiple nodes and to communicate gradients at each optimization step. By contrast, we investigate completely local fine-tuning, which we refer to as lo-fi. During lo-fi, each node is fine-tuned independently without any communication. Then, the weights are averaged across nodes at the conclusion of fine-tuning. When fine-tuning DeiT-base and DeiT-large on ImageNet, this procedure matches accuracy in-distribution and improves accuracy under distribution shift compared to the baseline, which observes the same amount of data but communicates gradients at each step. We also observe that lo-fi matches the baseline's performance when fine-tuning OPT language models (up to 1.3B parameters) on Common Crawl. By removing the communication requirement, lo-fi reduces resource barriers for fine-tuning large models and enables fine-tuning in settings with prohibitive communication cost.

연구 동기 및 목표

  • 대규모 사전학습된 모델의 분산 미세조정 중 노드 간 통신이 필수적인지 여부를 조사하는 것.
  • 노드 간 통신을 제거하여 대규모 모델 미세조정의 자원 및 인프라 장벽을 줄이는 것.
  • 미세조정 후 독립적으로 훈련된 모델의 평균화가 그래디언트 동기화가 필요한 표준 데이터 병렬 미세조정과 비교해 유사하거나 향상된 성능을 내는지 평가하는 것.
  • 높은 통신 비용 또는 개인정보 보호 제약 조건이 있는 환경에서 탈중앙화되고 통신 비용이 낮은 미세조정의 가능성 탐색

제안 방법

  • 각 노드는 그래디언트 교환 또는 동기화 없이 자체 데이터 파artition에서 전체 미세조정을 독립적으로 수행한다.
  • 훈련 후 최종 모델은 모든 노드의 학습된 가중치를 평균하여 구성된다: θ_lo-fi = (1/n) Σ θ^k.
  • 기존 베이스라인과 동일한 초모수 및 총 데이터 양을 사용하며, 유일한 차이점은 통신 패턴 뿐이다.
  • 표준 최적화 기법을 사용하여 가중치 감소와 확률적 깊이를 적용하고, 이 방법은 비전(DeiT) 및 언어 모델(OPT)에 적용된다.
  • 모델의 강건성 평가를 위해 ImageNet 및 분포 이탈 벤치마크(IN-V2, IN-R, Sketch, IN-A)에서 평가된다.
  • 모든 단계에서 그래디언트를 동기화하는 베이스라인과 비교하며, 최적 성능을 내기 위해 초모수를 조정한다.

실험 결과

연구 질문

  • RQ1노드 간 통신 없이도 분산 미세조정을 수행하면서 모델 정확도를 유지하거나 향상시킬 수 있는가?
  • RQ2미세조정 후 독립적으로 훈련된 모델의 평균화가 그래디언트 동기화가 필요한 표준 데이터 병렬 미세조정과 비교해 성능이 유사한가?
  • RQ3통신 비용이 높은 환경에서 lo-fi는 분포 이탈 상황에서 베이스라인 대비 어떻게 성능을 내는가?
  • RQ4lo-fi가 베이스라인보다 우수하거나 동등한 성능을 내는 설정은 무엇이며, 특히 데이터 효율성 및 모델 규모 측면에서 어떤가?

주요 결과

  • DeiT-base를 사용해 ImageNet에서 lo-fi는 86.00%의 top-1 정확도를 달성했으며, 베이스라인의 85.96%를 유지하거나 초월하면서 통신을 완전히 제거했다.
  • 분포 이탈 벤치마크에서 lo-fi는 베이스라인을 초월한다: DeiT-base 기준 IN-V2에서 +1.51%, Sketch에서 +1.19%, IN-A에서 +1.38% 향상.
  • DeiT-large의 경우 lo-fi는 ImageNet에서 87.10%의 정확도를 기록했으며, 베이스라인의 87.12%를 유지하거나 초월했고, IN-R(+0.07%) 및 IN-A(+0.56%)에서 더 높은 성능을 기록했다.
  • lo-fi는 통신 없이 OPT 언어 모델(최대 1.3B 파라미터)에서도 성능을 유지했으며, Common Crawl에서 베이스라인 정확도를 그대로 유지했다.
  • 이 방법은 통신 비용을 0으로 줄여 통신 오버헤드가 금기인 환경이나 개인정보 보호 제약 조건이 있는 환경에서도 미세조정을 가능하게 한다.
  • 추가 파라미터가 도입되지 않은 경우 lo-fi가 가장 우수한 성능을 내며, 추가 파라미터가 추가될 경우 성능 저하가 발생하고, 베이스라인 성능을 따라잡기 위해 더 많은 데이터가 필요하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.