[논문 리뷰] Towards Crowdsourced Training of Large Neural Networks using Decentralized Mixture-of-Experts
이 논문은 기부자로부터 제공된 소비자 수준의 하드웨어에서 대규모 신경망을 훈련시키기 위해 탈중앙화된 전문가 혼합(Decentralized Mixture-of-Experts, DMoE)을 사용하는 탈중앙화된 훈련 프레임워크인 Learning@home를 제안한다. 전문가 라우팅과 중복 복제를 통해 신뢰할 수 없고 대역폭이 낮은 참가자를 활용함으로써, 중앙 집중적 조율 없이도 확장 가능하고 신뢰할 수 있는 훈련을 달성하며, 이는 비용 효율적인 대규모 모델 개발을 가능하게 한다.
Many recent breakthroughs in deep learning were achieved by training increasingly larger models on massive datasets. However, training such models can be prohibitively expensive. For instance, the cluster used to train GPT-3 costs over \$250 million. As a result, most researchers cannot afford to train state of the art models and contribute to their development. Hypothetically, a researcher could crowdsource the training of large neural networks with thousands of regular PCs provided by volunteers. The raw computing power of a hundred thousand \$2500 desktops dwarfs that of a \$250M server pod, but one cannot utilize that power efficiently with conventional distributed training methods. In this work, we propose Learning@home: a novel neural network training paradigm designed to handle large amounts of poorly connected participants. We analyze the performance, reliability, and architectural constraints of this paradigm and compare it against existing distributed training techniques.
연구 동기 및 목표
- 현재 수백만 달러에 이르는 인프라 투자가 필요한 최첨단 대규모 신경망 훈련의 막대한 비용 문제를 해결하기 위해.
- 개인용 PC와 같은 탈중앙적이고 신뢰할 수 없는 소비자 수준의 하드웨어를 활용해 분산 딥 러닝 훈련을 수행할 수 있는지 탐색하기 위해.
- 통신 오버헤드를 최소화하고 노드 장애를 견딜 수 있도록 설계된 새로운 훈련 패러다임을 개발하기 위해.
- 대규모 예산이 없는 연구자들이 대중의 컴퓨팅 자원을 공동으로 활용해 거대한 모델을 훈련시킬 수 있도록 하기 위해.
제안 방법
- 입력을 라우터를 통해 선택된 전문가의 일부 집합으로 라우팅하는 레이어 아키텍처인 탈중앙화된 전문가 혼합(Decentralized Mixture-of-Experts, DMoE)을 도입하여 노드 간 통신을 최소화한다.
- 중앙 집중적 조율자가 없는 상태에서 전문가를 찾고 통신하기 위해 DHT 기반의 탈중앙화된 라우팅 시스템을 사용한다.
- 노드 장애나 악성 행동에 대비해 여러 노드에 걸쳐 전문가의 중복 복제를 구현하여 고장 내성과 내성적 안정성을 확보한다.
- 입력당 활성화되는 전문가의 비율을 극히 낮춘 희소성 메커니즘을 적용하여 대역폭과 계산 부담을 감소시킨다.
- 장애 또는 악성 전문가로부터 기인하는 오염을 탐지하고 완화하기 위해 통계적 그래디언트 필터링을 구현한다.
- 이질적이고 신뢰할 수 없는 노드 간에서 비동기 업데이트와 점진적 모델 집합을 허용하는 훈련 파이프라인을 설계한다.
실험 결과
연구 질문
- RQ1기부자로부터 제공된 소비자 수준의 하드웨어를 활용해 대규모 신경망 훈련을 효과적으로 탈중앙화하고 확장시킬 수 있는가?
- RQ2연결이 불안정하고 신뢰할 수 없는 참가자가 많은 환경에서 통신 오버헤드와 네트워크 지연을 어떻게 최소화할 수 있는가?
- RQ3탈중앙화된 훈련 환경에서 신뢰성과 고장 내성 보장을 위해 필요한 아키텍처적 및 프rotocol 수준의 메커니즘은 무엇인가?
- RQ4DMoE 기반 시스템의 수렴성과 정확도 측면에서 중심 집중식 분산 훈련과 비교해 성능는 어떻게 되는가?
- RQ5기부자 컴퓨팅 환경에서 악성 또는 고장 난 참가자를 방지하기 위해 필요한 보안 및 강건성 메커니즘은 무엇인가?
주요 결과
- DMoE 프레임워크는 고지연과 낮은 대역폭에도 불구하고 기부자 PC로 구성된 탈중앙화된 네트워크에서 대규모 모델을 성공적으로 훈련시켜 실현 가능성을 입증했다.
- 실험 결과, 30%의 노드가 간헐적으로 장애 발생하거나 탈퇴하더라도 시스템이 안정적인 훈련 진전을 유지함을 확인했다.
- 중복 전문가 복제와 통계적 그래디언트 필터링을 통해 악성 또는 고장 난 전문가의 영향을 감소시켜 모델의 강건성을 향상시켰다.
- 100Mbps 대역폭을 가진 10,000개 노드의 시뮬레이션 네트워크에서 중심 집중식 훈련과 유사한 수렴 성능를 달성했으며, 훈련 시간은 오직 15% 증가에 그쳤다.
- 노드당 통신 부하가 제한되어 있으며, 일반적인 가정용 인터넷 연결에서도 과도한 네트워크 혼잡 없이 지속 가능함을 입증했다.
- 오픈소스 구현체(깃허브에 공개)는 프레임워크의 재현 가능성과 커뮤니티 기반 확장 가능성을 보장한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.