Skip to main content
QUICK REVIEW

[논문 리뷰] Rail-only: A Low-Cost High-Performance Network for Training LLMs with Trillion Parameters

Weiyang Wang, Manya Ghobadi|arXiv (Cornell University)|2023. 07. 22.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 트리리온 파라미터를 가진 대규모 언어 모델(LLM)을 훈련하기 위해 고유한 통신 패턴을 활용한 저비용·고성능 네트워크 아키텍처인 Rail-Only를 제안한다. 완전한 임의의 대 임의의 연결성을 갖춘 대신 GPU를 고대역폭(HB) 도메인으로 분할하고, 유일하게 비영역 통신이 발생하는 쌍들만 연결함으로써 네트워크 비용을 37%에서 75%까지 감소시키며 성능 손실 없이도 가능하다.

ABSTRACT

This paper presents a low-cost network architecture for training large language models (LLMs) at hyperscale. We study the optimal parallelization strategy of LLMs and propose a novel datacenter network design tailored to LLM's unique communication pattern. We show that LLM training generates sparse communication patterns in the network and, therefore, does not require any-to-any full-bisection network to complete efficiently. As a result, our design eliminates the spine layer in traditional GPU clusters. We name this design a Rail-only network and demonstrate that it achieves the same training performance while reducing the network cost by 38% to 77% and network power consumption by 37% to 75% compared to a conventional GPU datacenter. Our architecture also supports Mixture-of-Expert (MoE) models with all-to-all communication through forwarding, with only 8.2% to 11.2% completion time overhead for all-to-all traffic. We study the failure robustness of Rail-only networks and provide insights into the performance impact of different network and training parameters.

연구 동기 및 목표

  • 트리리온 파라미터를 가진 LLM을 훈련하기 위한 대규모 GPU 클러스터의 비용과 복잡도 증가 문제를 해결한다.
  • LLM 훈련에 완전한 임의의 대 임의의 네트워크 연결성이 필수적이라는 가정을 도전한다.
  • 실제 LLM 통신 패턴에 부합하는 비용 효율적인 네트워크를 설계하여 인프라 오버헤드를 줄인다.
  • 불필요한 상호연결을 제거하여 네트워크 하드웨어를 최소화하면서도 훈련 성능을 유지한다.
  • LLM 하이퍼파라미터와 인프라 자원을 기반으로 훈련 반복 시간을 추정하는 분석 프레임워크를 제공한다.

제안 방법

  • LLM 훈련의 통신 패턴을 분석하여 고대역폭 통신이 소규모이고 국소화된 GPU 그룹(HB 도메인)에 국한됨을 규명한다.
  • 모든 GPU 간의 임의의 대 임의의 연결이 필요하지 않은 새로운 네트워크 아키텍처인 Rail-Only를 제안하며, 클러스터를 HB 도메인으로 분할하고 필수적인 도메인 간 링크만 연결한다.
  • 계산, 통신, 병렬화 전략을 고려한 분석 모델을 사용해 훈련 반복 시간을 추정한다.
  • 기존 Clos 토폴로지에서 활용되지 않는 링크를 제거함으로써 네트워크 비용을 감소시키는 것을 수립한다.
  • 장애 내성과 복구 전략을 통한 고장에 대한 내성을 확보하기 위해 장애 복구 메커니즘을 구현한다.
  • 이전 연구의 기준값과 비교하여 분석 모델을 검증하였으며, 부동소수점 활용도 추정 오차가 0.15% 미만으로 나타났다.
Figure 1: State-of-the-art GPU clusters are based on rail-optimized, any-to-any Clos networks Nvidia ( 2023a ) .
Figure 1: State-of-the-art GPU clusters are based on rail-optimized, any-to-any Clos networks Nvidia ( 2023a ) .

실험 결과

연구 질문

  • RQ1LLM 훈련은 실제로 클러스터 내 모든 GPU 간에 임의의 대 임의의 네트워크 연결성이 필요한가?
  • RQ2실제 LLM 훈련의 통신 요구사항에 부합하는 네트워크 아키텍처를 설계하여 비용을 줄일 수 있는가?
  • RQ3LLM를 위한 네트워크 설계를 이끌기 위해 훈련 반복 시간을 정확하게 모델링할 수 있는가?
  • RQ4대규모 GPU 클러스터에서 비필수 상호연결을 제거할 경우 성능와 비용의 트레이드오프는 어떻게 되는가?
  • RQ5제안된 Rail-Only 아키텍처는 네트워크 하드웨어를 크게 줄이면서도 성능을 유지할 수 있는가?

주요 결과

  • LLM 훈련은 고대역폭 임의의 대 임의의 연결이 필요한 소규모 국소 GPU 그룹(HB 도메인)에 국한되며, 그룹 간 통신은 미미하고 균일하다.
  • Rail-Only 아키텍처는 최첨단 Clos 네트워크 대비 네트워크 비용을 37%에서 75%까지 감소시키며 성능 저하 없이도 가능하다.
  • 훈련 반복 시간에 대한 분석 모델은 이전 연구의 기준값과 비교해 부동소수점 활용도 추정 오차가 0.15% 미만으로 매우 정확하다.
  • 32,768개 GPU 클러스터에서 Rail-Only는 최첨단 Clos 네트워크의 스위치 수 2,560개에서 1,536개로 감소시켜 37%의 비용 절감을 달성한다.
  • 128,000개 GPU 클러스터에서는 상위 수준 구성에서 스위치 수를 1,280개에서 256개로 줄여 비용 절감률이 75%에 이른다.
  • 논리적 도메인 분할을 통해 클러스터를 독립된 도메인으로 나누어 다중 작업 훈련 및 추론 워크로드와도 호환성을 유지한다.
Figure 2: Different parallelization strategy for training LLMs. Each color represents a different set of devices.
Figure 2: Different parallelization strategy for training LLMs. Each color represents a different set of devices.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.