[논문 리뷰] BRDS: An FPGA-based LSTM Accelerator with Row-Balanced Dual-Ratio Sparsification
이 논문은 에너지 소모를 줄이고 속도를 향상시키기 위해 새로운 로우-밸런스 듀얼 레이트 희소화 기법을 사용하는 FPGA 기반의 LSTM 가속기인 BRDS를 제안한다. LSTM 네트워크의 두 민감도가 높은 가중치 행렬에 서로 다른 희소성 비율을 적용하고, 로우 수준에서 희소성을 조직함으로써 효율적인 계산 오버랩과 파이프라인 처리를 가능하게 하여, PTB 데이터셋에서 퍼플렉서티가 감소한 상태에서 이전 연구 대비 최대 272% 높은 효과적 GOPS/W를 달성한다.
In this paper, first, a hardware-friendly pruning algorithm for reducing energy consumption and improving the speed of Long Short-Term Memory (LSTM) neural network accelerators is presented. Next, an FPGA-based platform for efficient execution of the pruned networks based on the proposed algorithm is introduced. By considering the sensitivity of two weight matrices of the LSTM models in pruning, different sparsity ratios (i.e., dual-ratio sparsity) are applied to these weight matrices. To reduce memory accesses, a row-wise sparsity pattern is adopted. The proposed hardware architecture makes use of computation overlapping and pipelining to achieve low-power and high-speed. The effectiveness of the proposed pruning algorithm and accelerator is assessed under some benchmarks for natural language processing, binary sentiment classification, and speech recognition. Results show that, e.g., compared to a recently published work in this field, the proposed accelerator could provide up to 272% higher effective GOPS/W and the perplexity error is reduced by up to 1.4% for the PTB dataset.
연구 동기 및 목표
- 하드웨어 우수한 프루닝을 통해 LSTM 신경망 가속기의 에너지 소비를 줄이고 속도를 향상시키기 위해.
- 프루닝 중 LSTM의 두 가중치 행렬이 민감도가 다르므로, 이에 따라 다른 희소성 비율(듀얼 레이트 희소성)을 적용하여 문제를 해결하기 위해.
- 프루닝된 가중치에 로우 단위 희소성 패턴을 강제 적용하여 메모리 액세스 오버헤드를 최소화하기 위해.
- 계산 오버랩과 파이프라인 처리를 활용한 고-throughput, 저전력 FPGA 기반 가속기 설계를 위해.
- 자연어 처리, 감성 분류, 음성 인식 워크로드에서 실세계 벤치마크를 대상으로 제안된 방법을 평가하기 위해.
제안 방법
- 두 LSTM 가중치 행렬의 민감도에 따라 서로 다른 희소성 수준을 적용하는 하드웨어 우수한 프루닝 알고리즘을 개발하였다.
- 메모리 액세스 효율성 향상과 저장 및 대역폭 요구량 감소를 위해 희소성을 로우 수준에서 강제 적용하였다.
- 파이프라인 처리와 계산 오버랩을 활용하여 최대의 처리량을 확보하고 지연을 최소화하는 FPGA 기반 가속기 아키텍처를 사용하였다.
- FPGA에 최적화된 설계로, 현장 내부 메모리와 병렬 처리 유닛을 활용하여 LSTM 내 희소 행렬-벡터 곱셈을 가속화하였다.
- 언어 모델링, 이진 감성 분류, 음성 인식 작업을 포함한 벤치마크에서 시스템을 평가하였다.
- 가속기는 FPGA 플랫폼에 구현되었으며, 최근에 발표된 최첨단 FPGA 기반 LSTM 가속기와 비교되었다.
실험 결과
연구 질문
- RQ1LSTM의 두 민감도가 높은 가중치 행렬에 독립적으로 듀얼 레이트 희소화를 적용할 경우, 에너지 효율성과 추론 정확도를 향상시킬 수 있는가?
- RQ2로우 단위 희소성 조직 방식은 FPGA 기반 LSTM 가속기에서 메모리 액세스와 성능에 어떤 영향을 미치는가?
- RQ3FPGA 아키텍처에서 파이프라인 처리와 계산 오버랩을 통해 희소 LSTM 추론의 처리량을 높이고 전력 소비를 줄일 수 있는 정도는 어느 정도인가?
- RQ4로우-밸런스 듀얼 레이트 희소화를 적용할 경우, 모델 정확도(예: 퍼플렉서티)와 에너지 효율성 사이의 상호 상충 관계는 어떻게 나타나는가?
- RQ5기존의 FPGA 기반 LSTM 가속기와 비교했을 때 제안된 가속기는 성능과 에너지 효율성 측면에서 어떤가?
주요 결과
- 제안된 BRDS 가속기는 최근에 발표된 FPGA 기반 LSTM 가속기 대비 최대 272% 높은 효과적 GOPS/W를 달성하였다.
- Penn Treebank(PTB) 데이터셋에서 기준값 대비 퍼플렉서티 오차가 최대 1.4% 감소하여 추론 정확도 향상이 확인되었다.
- 로우-밸런스 듀얼 레이트 희소화 기법은 두 LSTM 가중치 행렬에 높은 희소성 수준을 유지하면서도 모델 정확도를 효과적으로 보존하였다.
- FPGA 기반 구현은 메모리 액세스 감소와 효율적인 계산 오버랩 덕분에 뚜렷한 에너지 절감 효과를 보였다.
- 희소 행렬 연산을 위한 최적화된 데이터 플로우와 파이프라인 실행을 통해 고처리량을 유지하였다.
- 결과적으로 민감도 인식 희소성과 로우 단위 조직 방식이 FPGA 배포에 있어 효과적이며 하드웨어 우수한 방식임을 확인하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.