[논문 리뷰] MicroRec: Efficient Recommendation Inference by Hardware and Data Structure Solutions
MicroRec는 깊이 학습 기반 추천 시스템에서 발생하는 메모리 병목 현상을 줄이기 위해 카르테시안 곱을 활용한 데이터 구조 최적화와 FPGA에 탑재된 고대역폭 메모리(HBM)를 활용해 병렬 임베딩 검색을 실현하는 고성능 추천 추론 엔진을 제안한다. 이는 임베딩 검색에서 13.8–14.7×의 속도 향상을, CPU 기반 기준 대비 2.5–5.4×의 처리량 향상을 달성하며, 추론 지연 시간을 밀리초에서 마이크로초 수준으로 감소시킨다.
Deep neural networks are widely used in personalized recommendation systems. Unlike regular DNN inference workloads, recommendation inference is memory-bound due to the many random memory accesses needed to lookup the embedding tables. The inference is also heavily constrained in terms of latency because producing a recommendation for a user must be done in about tens of milliseconds. In this paper, we propose MicroRec, a high-performance inference engine for recommendation systems. MicroRec accelerates recommendation inference by (1) redesigning the data structures involved in the embeddings to reduce the number of lookups needed and (2) taking advantage of the availability of High-Bandwidth Memory (HBM) in FPGA accelerators to tackle the latency by enabling parallel lookups. We have implemented the resulting design on an FPGA board including the embedding lookup step as well as the complete inference process. Compared to the optimized CPU baseline (16 vCPU, AVX2-enabled), MicroRec achieves 13.8~14.7x speedup on embedding lookup alone and 2.5$~5.4x speedup for the entire recommendation inference in terms of throughput. As for latency, CPU-based engines needs milliseconds for inferring a recommendation while MicroRec only takes microseconds, a significant advantage in real-time recommendation systems.
연구 동기 및 목표
- 딥 러닝 기반 추천 추론의 메모리 병목 문제를 해결하기 위해, 임베딩 테이블 검색 과정에서 발생하는 고지연성 랜덤 DRAM 접근에 기인한 제약을 해소하는 것.
- 효율적인 데이터 구조 설계를 통해 희소 특성 임베딩 검색 시 메모리 접근 횟수를 줄이는 것.
- FPGA에 탑재된 고대역폭 메모리(HBM)를 활용해 동시 임베딩 검색을 가능하게 하고 추론 지연 시간을 감소시키는 것.
- 실시간 운영 환경에 적합한 저지연, 고처리량 추천 추론을 달성하는 것.
- 특수화된 DRAM 아키텍처나 대규모 프레임워크 최적화에 의존하지 않는 실용적이고 하드웨어 인식 설계를 제공하는 것.
제안 방법
- 검색 과정에서 랜덤 메모리 접근 횟수를 최소화하기 위해 카르테시안 곱을 활용한 임베딩 데이터 구조 재설계.
- HBM의 넓은 메모리 인터페이스가 제공하는 병렬성을 극대화하기 위해 깊이 파ip라이닝된 FPGA 아키텍처 구현.
- 임베딩 테이블을 여러 HBM 메모리 채널에 분산하여 동시 액세스 대역폭을 증가시키는 것.
- FPGA 가속기 상에서 전체 추론 파이프라인에 최적화된 임베딩 검색 기능 통합.
- 희소 특성 처리를 위한 대역폭 확장과 지연 감소를 위해 HBM를 포함한 하이브리드 메모리 시스템 도입.
- 프레임워크 수준의 오버헤드를 최소화하기 위해 계산 및 메모리 액세스를 고유 하드웨어로 이관하는 추론 파이프라인 최적화.
실험 결과
연구 질문
- RQ1카르테시안 곱 기반 데이터 구조가 추천 모델의 임베딩 검색 과정에서 랜덤 메모리 접근 횟수를 줄일 수 있는가?
- RQ2HBM를 탑재한 FPGA 가속기 아키텍처가 추천 추론에서 발생하는 메모리 장벽을 극복하기에 충분한 병렬성을 확보할 수 있는가?
- RQ3하드웨어 인식 데이터 구조 및 메모리 시스템 공동 설계가 종단 간 추론 처리량과 지연 시간에 얼마나 기여하는가?
- RQ4제안된 시스템은 최적화된 CPU 기반 추론 엔진과 비교해 지연 시간과 처리량 측면에서 어떻게 성능을 내는가?
- RQ5제안된 솔루션은 산업 규모의 추천 워크로드에서 고처리량을 유지하면서도 실시간 지연 요구사항(수십 밀리초 이내)을 충족할 수 있는가?
주요 결과
- MicroRec는 최적화된 16vCPU, AVX2 지원 CPU 기준 대비 임베딩 검색 성능에서 13.8–14.7×의 속도 향상을 달성한다.
- 전체 추천 추론 처리량은 CPU 기준 대비 2.5–5.4× 향상되어 체계적 성능 향상이 뚜렷하게 입증된다.
- 추론 지연 시간은 CPU 기반 시스템의 밀리초 수준에서 MicroRec에서는 마이크로초 수준으로 감소하여 실시간 추천 배포가 가능해진다.
- 카르테시안 곱의 활용은 임베딩 테이블 검색 횟수를 감소시켜 직접적으로 메모리 액세스 병목 문제를 해결한다.
- FPGA 기반 HBM를 통한 병렬화는 임베딩 검색에서 고도의 동시성을 실현하여 이 작업 워크로드의 메모리 장벽을 효과적으로 제거한다.
- 데이터 구조 최적화와 하드웨어 가속을 융합한 종단 간 시스템 설계는 추천 추론의 주요 성능 병목 요소를 성공적으로 제거한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.