[논문 리뷰] Centaur: A Chiplet-based, Hybrid Sparse-Dense Accelerator for Personalized Recommendations
Centaur는 개인화 추천 시스템에서 희소 임bedding과 조밀한 MLP 워크로드를 공동 최적화하는 칩렛 기반 하이브리드 FPGA 가속기이다. CPU+FPGA 패키지에 희소 가속기와 조밀한 GEMM 가속기를 통합함으로써, 인텔 HARPv2에서 CPU-only 추론 대비 1.7–17.2×의 성능 향상과 1.7–19.5×의 에너지 효율성 향상을 달성한다.
Personalized recommendations are the backbone machine learning (ML) algorithm that powers several important application domains (e.g., ads, e-commerce, etc) serviced from cloud datacenters. Sparse embedding layers are a crucial building block in designing recommendations yet little attention has been paid in properly accelerating this important ML algorithm. This paper first provides a detailed workload characterization on personalized recommendations and identifies two significant performance limiters: memory-intensive embedding layers and compute-intensive multi-layer perceptron (MLP) layers. We then present Centaur, a chiplet-based hybrid sparse-dense accelerator that addresses both the memory throughput challenges of embedding layers and the compute limitations of MLP layers. We implement and demonstrate our proposal on an Intel HARPv2, a package-integrated CPU+FPGA device, which shows a 1.7-17.2x performance speedup and 1.7-19.5x energy-efficiency improvement than conventional approaches.
연구 동기 및 목표
- 개인화 추천 워크로드에서 메모리 집약적인 희소 임베딩 레이어로 인해 발생하는 성능 저하 문제를 해결한다.
- 임베딩 및 MLP 레이어에 대해 낮은 메모리 대역폭 활용도와 열악한 계산 처리량을 겪는 CPU-only 추론의 한계를 극복한다.
- 개인화 추천 모델의 희소 및 조밀한 DNN 구성 요소를 공동 최적화하는 통합적이고 시스템 수준의 가속기를 설계한다.
- 시스템 또는 소프트웨어 스택 변경 없이 기존 데이터센터 인fra구조에 원활하게 통합될 수 있도록 패키지 통합 CPU+FPGA 기술을 활용한다.
- 특수 메모리 아키텍처나 ISA 수정 없이도 생산 규모의 추천 모델에서 높은 성능과 에너지 효율성을 달성한다.
제안 방법
- 인텔 HARPv2의 패키지 통합 CPU+FPGA 하드웨어를 활용하여 CPU와 FPGA 간 고대역폭, 저지연성 통신을 가능하게 한다.
- 불규칙적이고 국소성이 낮은 임베딩 수집 작업을 고메모리 수준 병렬성으로 처리할 수 있도록 전용 희소 가속기를 설계한다.
- 계산 집약적인 다층 퍼셉트론(MLP) 레이어를 효율적으로 처리하기 위해 FPGA에 고처리량 조밀한 GEMM 가속기를 구현한다.
- 다양한 워크로드에 맞는 전용 가속기를 단일 패키지 내에서 확장 가능하고 모듈러하게 통합할 수 있도록 칩렛 기반 아키텍처를 사용한다.
- 희소 및 조밀 워크로드 양쪽 모두의 지연 최소화와 대역폭 활용도 최대화를 위해 데이터 플로우 및 메모리 액세스 패턴을 최적화한다.
- CPU ISA, 런타임 또는 시스템 소프트웨어를 수정하지 않음으로써 기존 소프트웨어 스택과 서버 하드웨어와의 호환성을 확보한다.
실험 결과
연구 질문
- RQ1CPU 중심의 추천 추론 시스템에서 희소 임베딩 레이어의 메모리 대역폭 제약을 어떻게 효과적으로 완화할 수 있는가?
- RQ2FPGA 기반 하드웨어 가속이 추천 모델의 희소 및 조밀 구성 요소 양쪽에 대해 성능과 에너지 효율성 향상에 얼마나 기여할 수 있는가?
- RQ3칩렛 기반 CPU+FPGA 아키텍처는 임베딩과 MLP 워크로드를 효과적으로 오프로드하기에 충분한 대역폭과 낮은 지연을 제공할 수 있는가?
- RQ4실제 추천 워크로드에서 하이브리드 희소-조밀 가속기의 성능 및 효율성은 기존 CPU-only 추론 대비 어떻게 비교되는가?
- RQ5기존 데이터센터 인fra구조를 교란하지 않고도 희소 및 조밀 DNN 구성 요소를 공동 가속화하는 시스템을 설계할 때 고려해야 할 주요 아키텍처적 트레이드오프는 무엇인가?
주요 결과
- 생산용 추천 모델에서 희소 임베딩 레이어가 추론 시간의 최대 79%를 차지하여 CPU-only 시스템에서 주요 성능 저하 요인으로 작용한다.
- CPU 메모리 시스템은 임베딩 검색의 불규칙한 액세스 패턴으로 인해 고수준 캐시 실패율이 높고, 메모리 대역폭 활용도가 낮다.
- Centaur 가속기는 인텔 HARPv2 플랫폼에서 CPU-only 추론 대비 1.7–17.2×의 성능 향상을 달성하여 뚜렷한 성능 향상을 입증한다.
- Centaur는 CPU-only 시스템 대비 1.7–19.5×의 에너지 효율성 향상을 제공하여 머신러닝 추론 분야에서의 에너지 효율성 우수성을 입증한다.
- 칩렛 기반 FPGA 설계는 CPU와 가속기 간 고대역폭, 저지연성 통신을 가능하게 하여 고처리량을 유지하는 데 핵심적이다.
- Centaur는 기존 소프트웨어 및 하드웨어 스택에 영향을 주지 않아, 시스템 수정 없이 현재 데이터센터 환경에 즉시 배치할 수 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.