[논문 리뷰] First-Generation Inference Accelerator Deployment at Facebook
페이스북은 PCIe를 통해 연결된 6개의 저전력 카드(각 13W)를 공ออกแบบ한 고성능·에너지 효율적인 추론 가속기 시스템을 개발하여, 91W 전력 소비 내에서 180–270 TOPS(int8) 성능과 96GB의 LPDDR 메모리를 달성했다. 오픈소스 소프트웨어(파이토치, 카페2, 글로우)와 OCP 하드웨어 기반의 오픈 생태계를 통해 대규모 머신러닝 모델—특히 복잡한 자연어 처리 및 추천 시스템—의 효율적 구현이 가능해졌으며, 이는 CPU 대비 지연 시간과 처리량 면에서 뛰어난 성능을 보였다.
In this paper, we provide a deep dive into the deployment of inference accelerators at Facebook. Many of our ML workloads have unique characteristics, such as sparse memory accesses, large model sizes, as well as high compute, memory and network bandwidth requirements. We co-designed a high-performance, energy-efficient inference accelerator platform based on these requirements. We describe the inference accelerator platform ecosystem we developed and deployed at Facebook: both hardware, through Open Compute Platform (OCP), and software framework and tooling, through Pytorch/Caffe2/Glow. A characteristic of this ecosystem from the start is its openness to enable a variety of AI accelerators from different vendors. This platform, with six low-power accelerator cards alongside a single-socket host CPU, allows us to serve models of high complexity that cannot be easily or efficiently run on CPUs. We describe various performance optimizations, at both platform and accelerator level, which enables this platform to serve production traffic at Facebook. We also share deployment challenges, lessons learned during performance optimization, as well as provide guidance for future inference hardware co-design.
연구 동기 및 목표
- 점점 더 복잡해지는 머신러닝 모델로 인해 페이스북 데이터센터에서 고성능·저지연 추론의 수요가 증가함에 따라 이를 해결하기 위해.
- 특히 희소 메모리 액세스, 높은 모델 크기, 대역폭 요구 사항을 가진 대규모 모델에 대해 CPU 기반 추론의 한계를 극복하기 위해.
- 다양한 머신러닝 워크로드(NLP, 컴퓨터 비전, 추천 시스템)를 고성능 및 에너지 효율적으로 지원하는 하드웨어-소프트웨어 스택을 공동 설계하기 위해.
- 다양한 벤더의 AI 가속기와 프레임워크 간의 확장성 및 상호운용성을 보장하기 위해 오픈 생태계를 구축하기 위해.
- 모델, 카드, 연산자, 시스템 수준에서 최적화하여 실환경에서의 활용도를 극대화하고 지연 시간을 최소화하기 위해.
제안 방법
- PCIe 스위치를 통해 연결된 저전력·고TOPS/W 카드(30–45 TOPS/int8, 4–6 TFLOPS/FP16)를 사용해 6개 카드로 구성된 가속기 시스템을 공동 설계하여 성능과 메모리 용량을 확장했다.
- 대규모 추천 시스템 모델에 최적화된 다중 카드 파artition 전략을 도입하여 임베딩 테이블과 계산을 카드 간에 효율적으로 분산시켰다.
- 모델 수준(양자화, 연산자 공동 설계), 카드 수준(그래프 파artition, 배치 처리, 코어 배치), 시스템 수준(서빙 스택 수정)에서 소프트웨어 스택 최적화를 구현했다.
- 오픈소스 프레임워크(파이토치, 카페2, 글로우)와 도구(ONNXifi)를 활용해 이식성과 다양한 가속기 및 모델 유형 지원을 보장했다.
- 프로그래밍 가능한 벡터 코어를 통해 4비트 양자화 및 레인지 기반 프루닝과 같은 향후 모델 압축 기법을 런타임에서 지원할 수 있도록 했다.
- 향후 하드웨어 확장 기술로는 통합 비디오 디코딩 및 프로그래밍 가능한 메모리 내 처리(PIM)를 탐색하여 향후 모델 및 워크로드 변화에 대응할 수 있도록 했다.
실험 결과
연구 질문
- RQ1페이스북의 대규모 실환경 머신러닝 워크로드에 특화된 확장성 있고 에너지 효율적인 추론 가속기 시스템을 공동 설계하는 방법은 무엇인가?
- RQ2다중 카드 가속기 플랫폼에 복잡한 모델을 구현할 때 고성능과 낮은 지연 시간을 달성하기 위해 필요한 소프트웨어 및 시스템 수준 최적화는 무엇인가?
- RQ3다양한 AI 가속기와 프레임워크 간의 상호운용성을 지원하기 위해 오픈 하드웨어 및 소프트웨어 생태계를 어떻게 아키텍처화할 수 있는가?
- RQ4프로그래밍 가능성은 4비트 양자화 및 레인지 기반 프루닝과 같은 진화하는 모델 압축 및 최적화 기법을 지원하는 데 어떤 역할을 하는가?
- RQ5비디오 디코더나 메모리 내 처리(PIM)와 같은 전용 구성 요소를 가속기 시스템에 확장함에 있어 주요 과제와 기회는 무엇인가?
주요 결과
- 6개 카드로 구성된 가속기 시스템은 180–270 TOPS(int8)와 24–36 TFLOPS( FP16) 성능을 제공하며, 96GB의 LPDDR 메모리와 함께 최대 2.0–3.0 TOPS/W의 효율성을 달성했다.
- 소프트웨어 최적화 이후, 시스템은 기존 모델보다 최대 300배 더 큰 추천 시스템 모델을 효율적으로 제공할 수 있었으며, 이는 CPU에서는 메모리 및 계산 자원 부족으로 인해 구현이 불가능한 수준이었다.
- OCP 하드웨어와 오픈소스 소프트웨어(파이토치, 카페2, 글로우, ONNXifi) 기반의 오픈 생태계는 다양한 벤더와 프레임워크를 지원하여 더 넓은 혁신과 이식성을 가능하게 했다.
- 모델 수준 최적화인 양자화와 연산자 공동 설계가 성능 향상과 가속기 카드의 메모리 부담 감소에 크게 기여했다.
- 프로그래밍 가능한 벡터 코어 덕분에 초기 하드웨어 설계 이후에도 4비트 양자화 및 레인지 기반 프루닝과 같은 신규 압축 기법을 런타임에서 지원할 수 있었다.
- 특히 자연어 처리 및 추천 시스템 분야의 고복잡도 모델에 대해 CPU 기반 추론 대비 처리량과 지연 시간 면에서 뚜렷한 향상을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.