Skip to main content
QUICK REVIEW

[논문 리뷰] MicroRec: Accelerating Deep Recommendation Systems to Microseconds by Hardware and Data Structure Solutions.

Wenqi Jiang, Zhenhao He|arXiv (Cornell University)|2020. 10. 12.
Advanced Image and Video Retrieval Techniques참고 문헌 61인용 수 4
한 줄 요약

MicroRec는 딥 리커멘데이션 시스템을 위한 하드웨어 및 데이터 구조 최적화된 추론 엔진을 제안하며, 데이터 구조 재설계와 FPGA에 통합된 고대역폭 메모리(HBM)를 활용하여 임베딩 룩업 지연을 감소시킨다. 이는 CPU 기반 기준 대비 임베딩 룩업에서 13.8–14.7배의 성능 향상을 이끌어내며, 처리량은 2.5–5.4배 향상되어 추론 지연을 밀리초에서 마이크로초 수준으로 감소시킨다.

ABSTRACT

Deep neural networks are widely used in personalized recommendation systems. Unlike regular DNN inference workloads, recommendation inference is memory-bound due to the many random memory accesses needed to lookup the embedding tables. The inference is also heavily constrained in terms of latency because producing a recommendation for a user must be done in about tens of milliseconds. In this paper, we propose MicroRec, a high-performance inference engine for recommendation systems. MicroRec accelerates recommendation inference by (1) redesigning the data structures involved in the embeddings to reduce the number of lookups needed and (2) taking advantage of the availability of High-Bandwidth Memory (HBM) in FPGA accelerators to tackle the latency by enabling parallel lookups. We have implemented the resulting design on an FPGA board including the embedding lookup step as well as the complete inference process. Compared to the optimized CPU baseline (16 vCPU, AVX2-enabled), MicroRec achieves 13.8~14.7x speedup on embedding lookup alone and 2.5$~5.4x speedup for the entire recommendation inference in terms of throughput. As for latency, CPU-based engines needs milliseconds for inferring a recommendation while MicroRec only takes microseconds, a significant advantage in real-time recommendation systems.

연구 동기 및 목표

  • 메모리 기반의 임베딩 룩업으로 인한 추론 시스템의 높은 지연을 해결하기 위해.
  • 추론 중 임베딩 테이블의 랜덤 메모리 액세스로 인한 성능 저하 문제를 극복하기 위해.
  • 밀리초에서 마이크로초 수준으로 추론 지연을 감소시켜 실시간 추론을 가능하게 하기 위해.
  • FPGA 기반 고대역폭 메모리(HBM)를 활용하여 병렬 임베딩 룩업을 지원하고 처리량을 향상시키기 위해.
  • 생산 수준의 추론 워크로드에서 고처리량과 초저지연을 달성하는 시스템 설계를 위해.

제안 방법

  • 추론 중에 필요한 메모리 룩업 횟수를 최소화하기 위해 임베딩 데이터 구조를 재설계하기 위해.
  • FPGA 가속기의 고대역폭 메모리(HBM)를 활용하여 임베딩 테이블에 대한 병렬 액세스를 가능하게 하기 위해.
  • 임베딩 룩업 및 이후 신경망 계산을 포함한 FPGA 기반 완전한 추론 파이프라인을 구현하기 위해.
  • HBM를 탑재한 FPGA에서 지연을 줄이고 대역폭 활용도를 향상시키기 위해 메모리 액세스 패턴을 최적화하기 위해.
  • 최적화된 데이터 구조와 HBM 액세스를 하나의 종단 간 추론 엔진으로 통합하여 리커멘데이션 시스템에 적용하기 위해.

실험 결과

연구 질문

  • RQ1데이터 구조 최적화를 통해 딥 리커멘데이션 시스템에서 임베딩 룩업 지연을 어떻게 감소시킬 수 있는가?
  • RQ2FPGA에 탑재된 HBM가 리커멘데이션 추론에서 병렬 임베딩 룩업을 얼마나 가속화할 수 있는가?
  • RQ3CPU 기반 추론을 FPGA 기반 설계로 대체함으로써 처리량과 지연에서 어떤 성능 향상을 달성할 수 있는가?
  • RQ4데이터 구조 재설계와 HBM 활용의 조합이 마이크로초 이내의 추론 응답 시간을 달성할 수 있는가?
  • RQ5제안된 MicroRec 시스템은 최적화된 CPU 기반 기준 대비 리커멘데이션 워크로드에서 지연과 처리량 측면에서 어떻게 비교되는가?

주요 결과

  • MicroRec는 최적화된 CPU 기준(16 vCPU, AVX2 지원) 대비 임베딩 룩업 성능에서 13.8–14.7배의 성능 향상을 달성한다.
  • 시스템은 전체 추론 파이프라인에서 CPU 기준 대비 2.5–5.4배 높은 처리량을 제공한다.
  • CPU에서 밀리초 수준이던 추론 지연이 MicroRec에서는 마이크로초 수준으로 감소하여 실시간 추론을 가능하게 한다.
  • FPGA에 탑재된 HBM를 활용함으로써 임베딩 룩업의 효율적 병렬화가 가능해져 메모리 액세스 병목 현상을 크게 줄였다.
  • FPGA 기반 종단 간 설계가 최적화된 데이터 구조와 하드웨어 가속을 성공적으로 통합하여 초저지연 추론을 실현했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.