[논문 리뷰] AccelTran: A Sparsity-Aware Accelerator for Dynamic Inference with Transformers
AccelTran은 런타임 활성화 프루닝을 통해 동적 인퍼런스를 구현하는 스파arsity 인식 가속기로, 비효율적 연산을 줄여 더 높은 스루풋과 에너지 효율성을 달성한다. 아키텍처는 타일링된 행렬 연산과 최적화된 데이터플로우를 사용하여, 라즈베리 파이 대비 최대 1.33× 높은 스파arsity와 330K× 높은 스루풋, 93K× 낮은 에너지 소비를 달성하며, Energon 대비 스루풋은 5.73× 높고 에너지 효율성은 3.69× 높다.
Self-attention-based transformer models have achieved tremendous success in the domain of natural language processing. Despite their efficacy, accelerating the transformer is challenging due to its quadratic computational complexity and large activation sizes. Existing transformer accelerators attempt to prune its tokens to reduce memory access, albeit with high compute overheads. Moreover, previous works directly operate on large matrices involved in the attention operation, which limits hardware utilization. In order to address these challenges, this work proposes a novel dynamic inference scheme, DynaTran, which prunes activations at runtime with low overhead, substantially reducing the number of ineffectual operations. This improves the throughput of transformer inference. We further propose tiling the matrices in transformer operations along with diverse dataflows to improve data reuse, thus enabling higher energy efficiency. To effectively implement these methods, we propose AccelTran, a novel accelerator architecture for transformers. Extensive experiments with different models and benchmarks demonstrate that DynaTran achieves higher accuracy than the state-of-the-art top-k hardware-aware pruning strategy while attaining up to 1.2$ imes$ higher sparsity. One of our proposed accelerators, AccelTran-Edge, achieves 330K$ imes$ higher throughput with 93K$ imes$ lower energy requirement when compared to a Raspberry Pi device. On the other hand, AccelTran-Server achieves 5.73$ imes$ higher throughput and 3.69$ imes$ lower energy consumption compared to the state-of-the-art transformer co-processor, Energon. The simulation source code is available at https://github.com/jha-lab/acceltran.
연구 동기 및 목표
- 트랜스포머 인퍼런스의 높은 계산 및 메모리 오버헤드를 해결하기 위해, 이는 제곱형 복잡도와 큰 활성화 크기로 인해 발생한다.
- 낮은 오버헤드로 런타임 활성화 프루닝을 통해 어텐션 메커니즘의 비효율적 연산을 줄이기 위해.
- 처리 요소 간의 데이터 재사용을 향상시키고 하드웨어 활용도를 개선하기 위해 행렬 타일링과 다양한 데이터플로우 전략을 통해 하드웨어 활용도와 에너지 효율성을 향상시키기 위해.
- 특화된 가속기 버전(.AccelTran-Edge 및 AccelTran-Server)을 통해 엣지 및 서버 플랫폼에서 고스루풋, 저에너지 인퍼런스를 가능하게 하기 위해.
- 기존 가속기들이 무게 스파arsity에만 집중하거나 단일 행렬 처리 방식을 사용해 데이터 재사용이 열악하고 병렬화 수준이 낮은 한계를 극복하기 위해.
제안 방법
- 최소한의 계산 오버헤드로 런타임에 활성화를 프루닝하는 동적 인퍼런스 기법인 DynaTran을 제안하여 중간 활성화의 스파arsity를 증가시킨다.
- 데이터 재사용을 향상시키고 처리 요소 간의 하드웨어 활용도를 개선하기 위해 행렬 타일링과 다양한 데이터플로우 전략을 적용한다.
- 소프트웨어-하드웨어 최적화된 연산을 위한 전용 RTL 모듈(소프트맥스, 레이어 정규화, DynaTran 연산)을 탑재한 사이클 정확한 가속기 아키텍처인 AccelTran을 설계하여 핵심 연산을 단일 사이클 내로 실행한다.
- 트랜스포머 계산 그래프를 타일링된 하드웨어 최적화 연산으로 매핑하고 동적으로 최적의 데이터플로우를 선택하는 새로운 제어 블록을 도입한다.
- 모델 이동 프루닝 기반의 무게 및 활성화 스파arsity를 통합하여 트랜스포머 파이프라인 전반의 모든 곱셈 연산에서 스파arsity를 활용한다.
- 이동 플랫폼용 AccelTran-Edge와 클라우드 규모 인퍼런스를 위한 AccelTran-Server로 나누어 엣지 및 서버 배포에 최적화된 두 가지 버전을 제공한다.

실험 결과
연구 질문
- RQ1런타임 활성화 프루닝을 통한 동적 인퍼런스는 정확도를 유지하면서 트랜스포머 인퍼런스의 스루풋과 에너지 효율성을 향상시킬 수 있는가?
- RQ2어떻게 행렬 타일링과 다양한 데이터플로우 전략을 활용하여 트랜스포머 가속기에서 데이터 재사용과 하드웨어 활용도를 향상시킬 수 있는가?
- RQ3하드웨어 인식 트랜스포머 가속기에서 무게와 활성화의 스파arsity를 동시에 얼마나 효과적으로 활용할 수 있는가?
- RQ4하드웨어 인식 동적 인퍼런스 기법은 정적 프루닝 또는 top-k 전략에 비해 정확도와 성능 측면에서 어떻게 비교되는가?
- RQ5동일한 가속기 아키텍처로 엣지와 서버 플랫폼의 서로 다른 성능 및 전력 제약을 효율적으로 지원할 수 있는가?
주요 결과
- DynaTran은 최신의 top-k 하드웨어 인식 프루닝 전략 대비 최대 1.33× 높은 스파arsity를 달성하며, 더 높은 정확도를 유지한다.
- AccelTran-Edge는 라즈베리 파이 기기 대비 330,000× 높은 스루풋과 93,000× 낮은 에너지 소비를 기록한다.
- AccelTran-Server는 최신의 Energon 공처리장치 대비 5.73× 높은 스루풋과 3.69× 낮은 에너지 소비를 달성한다.
- 제안된 가속기 아키텍처는 무게뿐만 아니라 활성화의 스파arsity까지 활용함으로써 더 높은 스루풋과 에너지 효율성을 달성한다.
- 행렬 타일링과 최적화된 데이터플로우는 하드웨어 활용도를 크게 향상시켜 단일 행렬 처리나 행렬-벡터 분해 방식에 비해 뛰어난 성능을 제공한다.
- 제어 블록은 동적 스케줄링과 데이터플로우 선택을 가능하게 하여 고병렬화된 동일한 트랜스포머 레이어의 효율적 실행을 지원한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.