[논문 리뷰] Designing Efficient LLM Accelerators for Edge Devices
이 논문은 자원이 제한된 엣지 디바이스에서 대규모 언어 모델(Large Language Model, LLM) 추론을 위한 효율적인 하드웨are-소프트웨어 공동 설계 가속기 개발을 단순화하는 새로운 FPGA 기반 가속기 설계 플랫폼인 SECDA-LLM을 제안한다. SECDA 방법론을 llama.cpp 추론 프레임워크와 통합함으로써, 맞춤형 가속기의 빠른 프로토타이핑 및 구현을 가능하게 하며, 블록 부동소수점 양자화된 MatMul 가속기를 사용하여 TinyLlama 모델의 경우 이중 코어 ARM NEON CPU 실행 대비 11배의 성능 향상을 달성한다.
The increase in open-source availability of Large Language Models (LLMs) has enabled users to deploy them on more and more resource-constrained edge devices to reduce reliance on network connections and provide more privacy. However, the high computation and memory demands of LLMs make their execution on resource-constrained edge devices challenging and inefficient. To address this issue, designing new and efficient edge accelerators for LLM inference is crucial. FPGA-based accelerators are ideal for LLM acceleration due to their reconfigurability, as they enable model-specific optimizations and higher performance per watt. However, creating and integrating FPGA-based accelerators for LLMs (particularly on edge devices) has proven challenging, mainly due to the limited hardware design flows for LLMs in existing FPGA platforms. To tackle this issue, in this paper we first propose a new design platform, named SECDA-LLM, that utilizes the SECDA methodology to streamline the process of designing, integrating, and deploying efficient FPGA-based LLM accelerators for the llama.cpp inference framework. We then demonstrate, through a case study, the potential benefits of SECDA-LLM by creating a new MatMul accelerator that supports block floating point quantized operations for LLMs. Our initial accelerator design, deployed on the PYNQ-Z1 board, reduces latency 1.7 seconds per token or ~2 seconds per word) by 11x over the dual-core Arm NEON-based CPU execution for the TinyLlama model.
연구 동기 및 목표
- 높은 계산 및 메모리 요구량으로 인해 자원이 제한된 엣지 디바이스에 대규모 언어 모델(LLM)을 구현하는 데 도전하는 문제를 해결하기 위해.
- 사용자 정의 FPGA 기반 가속기 개발의 복잡성과 개발 비용을 줄이기 위해, 간소화된 설계 플로우를 제공함으로써 LLM 추론을 위한 FPGA 기반 가속기 개발의 복잡성과 개발 비용을 감소시키기 위해.
- 특히 양자화된 연산을 위한 최적화된 하드웨어-소프트웨어 공동 설계 최적화를 가능하게 하기 위해.
- 블록 부동소수점 양자화된 MatMul 연산을 위한 전용 FPGA 가속기의 구현 가능성과 성능 향상을 입증하기 위해.
- 미래의 엣지 LLM 가속화 개발 및 협업을 위한 재사용 가능하고 확장 가능한 플랫폼을 제공하기 위해.
제안 방법
- SECDA-LLM 플랫폼은 SECDA 방법론을 llama.cpp 추론 프레임워크와 통합하여 FPGA 기반 LLM 가속기의 하드웨어-소프트웨어 공동 설계를 가능하게 한다.
- 플랫폼은 AXI-API 통합 및 프로파일링 도구를 지원하여 가속기 개발, 통합, 성능 평가를 간소화한다.
- 효율적인 계산을 위해 명령어 디코더, 데이터 매핑기, 스케줄러, 슈퍼 블록 벡터 프로세서(Super-Block Vector Processor, SBVP)를 포함한 맞춤형 MatMul 가속기를 설계하였다.
- 가속기는 블록 부동소수점 양자화(Q3_K는 가중치, Q8_K는 입력값)를 지원하며, 각 테일(_tile_)과 전역 스케일링 인자를 갖는 슈퍼 블록(Super-Blocks, SBs)을 사용하여 모델 정확도를 유지한다.
- 슈퍼 블록을 片상 메모리 버퍼에 매핑하여 메모리 접근 지연을 최소화하고, 내적 곱 연산의 파이프라인 실행을 가능하게 한다.
- 가속기는 PYNQ-Z1 FPGA 보드에 배치되었으며, llama.cpp 런타임과 통합되어 CPU의 MatMul 연산을 가속기로 이관하였다.
![Figure 1 : Overview of the SECDA methodology [ 11 ] . Components in the dashed lines correspond to simulation, and in the dotted lines to execution on real hardware.](https://ar5iv.labs.arxiv.org/html/2408.00462/assets/files/SECDA_meth.png)
실험 결과
연구 질문
- RQ1통합된 설계 플랫폼이 자원 제한된 엣지 디바이스에서 FPGA 기반 LLM 추론 가속기 개발의 복잡성과 소요 시간을 크게 줄일 수 있는가?
- RQ2SECDA-LLM를 활용한 하드웨어-소프트웨어 공동 설계가 제약 조건이 있는 엣지 하드웨어에서 양자화된 LLM의 추론 성능을 얼마나 향상시킬 수 있는가?
- RQ3블록 부동소수점 양자화된 MatMul 연산을 위한 맞춤형 FPGA 가속기가 LLM 추론의 지연 시간을 줄이는 데 얼마나 효과적인가?
- RQ4이중 코어 ARM NEON CPU에서 MatMul 연산을 FPGA 가속기로 이관함으로써 엣지 디바이스에서 어떤 성능 향상을 달성할 수 있는가?
- RQ5SECDA-LLM 플랫폼이 새로운 LLM 양자화 기법을 위한 신규 가속기 설계의 빠른 프로토타이핑 및 평가를 지원할 수 있는가?
주요 결과
- SECDA-LLM 플랫폼은 하드웨어 설계 플로우를 llama.cpp 추론 프레임워크와 통합함으로써 FPGA 기반 LLM 가속기 개발을 효율적이고 종단 간(end-to-end)으로 가능하게 한다.
- 맞춤형 MatMul 가속기는 TinyLlama 모델의 경우 이중 코어 ARM NEON CPU 실행 대비 11배의 성능 향상을 달성하여, 토큰당 지연 시간을 1.7초로 감소시켰다.
- 가속기는 블록 부동소수점 양자화(Q3_K 및 Q8_K)를 성공적으로 지원하며, 제한된 엣지 하드웨어에서 효율적인 계산을 가능하게 하면서도 모델 정확도를 유지하였다.
- 각 테일 및 전역 스케일링 인자를 갖는 슈퍼 블록의 사용은 정밀도 손실를 최소화하면서 정밀한 계산을 가능하게 하여 LLM 성능 유지에 핵심적인 역할을 하였다.
- 실행 프로파일링 결과, 가속기 설계가 유휴 사이클을 효과적으로 최소화하고 추론 중 FPGA 자원의 고도로 활용됨을 확인하였다.
- 사례 연구는 SECDA-LLM이 엣지 FPGA에서 최적화된 LLM 가속기 개발 및 배포의 진입 장벽을 크게 감소시킨다는 것을 입증한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.