Skip to main content
QUICK REVIEW

[논문 리뷰] Energon: Towards Efficient Acceleration of Transformers Using Dynamic Sparse Attention

Zhe Zhou, Junlin Liu|arXiv (Cornell University)|2021. 10. 18.
Advanced Neural Network Applications인용 수 7
한 줄 요약

Energon은 혼합 정밀도 다중 라운드 필터링(MP-MRF) 알고리즘을 통해 런타임에 중요한 쿼리-키 쌍을 저정밀도 연산으로 식별하고, 이들 쌍에 대해서만 고정밀도 연산을 적용함으로써 동적 스퍼스 어텐션을 통해 트랜스포머의 가속을 위한 공동 설계 프레임워크를 제안한다. 이 방법은 NLP 및 CV 워크로드에서 CPU 및 GPU 베이스라인 대비 최대 168배의 성능 향상과 10⁴배의 에너지 절감을 달성한다.

ABSTRACT

In recent years, transformer models have revolutionized Natural Language Processing (NLP) and shown promising performance on Computer Vision (CV) tasks. Despite their effectiveness, transformers' attention operations are hard to accelerate due to the complicated data movement and quadratic computational complexity, prohibiting the real-time inference on resource-constrained edge-computing platforms. To tackle this challenge, we propose Energon, an algorithm-architecture co-design approach that accelerates various transformers using dynamic sparse attention. With the observation that attention results only depend on a few important query-key pairs, we propose a Mix-Precision Multi-Round Filtering (MP-MRF) algorithm to dynamically identify such pairs at runtime. We adopt low bitwidth in each filtering round and only use high-precision tensors in the attention stage to reduce overall complexity. By this means, we significantly mitigate the computational cost with negligible accuracy loss. To enable such an algorithm with lower latency and better energy efficiency, we also propose an Energon co-processor architecture. Elaborated pipelines and specialized optimizations jointly boost the performance and reduce power consumption. Extensive experiments on both NLP and CV benchmarks demonstrate that Energon achieves $168 imes$ and $8.7 imes$ geo-mean speedup and up to $10^4 imes$ and $10^3 imes$ energy reduction compared with Intel Xeon 5220 CPU and NVIDIA V100 GPU. Compared to state-of-the-art attention accelerators SpAtten and $A^3$, Energon also achieves $1.7 imes, 1.25 imes$ speedup and $1.6 imes, 1.5 imes $ higher energy efficiency.

연구 동기 및 목표

  • 자신의 어텐션 기능이 높은 계산 및 메모리 오버헤드를 가지는 트랜스포머의 문제를 해결하며, 특히 자원이 제한된 엣지 플랫폼에서의 성능을 향상시키기 위해 노력한다.
  • SpAtten 및 A³와 같은 이전의 스퍼스 어텐션 방법들이 고정된 프루닝 전략, 높은 외부 메모리 액세스, 또는 모델 재학습이 필요로 하는 등의 한계를 극복한다.
  • 정확도를 유지하면서도 복잡성을 크게 줄이는 효율적이고 동적이며 하드웨어 인지적인 어텐션 계산을 가능하게 한다.
  • MP-MRF 알고리즘을 효율적으로 가속화하기 위한 최적화된 파이프라인과 메모리 액세스 패턴을 갖춘 공동 프로세서 아키텍처를 설계한다.
  • 클라우드 및 엣지 환경에서의 실제 구현 사례를 포함한 다양한 NLP 및 CV 벤치마크에서 이 방법의 효과성을 입증한다.

제안 방법

  • 저비트폭 연산을 사용하여 런타임에 중요한 쿼리-키 쌍을 동적으로 식별하는 혼합 정밀도 다중 라운드 필터링(MP-MRF) 알고리즘을 제안한다.
  • 여러 라운드에 걸쳐 저정밀도(예: 4비트) 필터링을 적용하여 중요도가 높은 어텐션 쌍의 검색 공간을 점진적으로 축소하고, 고정밀도 어텐션 계산 이전에 최적화된 상태로 만든다.
  • 최종 어텐션 계산에 대해서만 고정밀도(예: 16비트) 텐서를 사용하여 총 계산 비용을 최소화한다.
  • MP-MRF 및 스퍼스 어텐션 실행을 가속화하기 위해 특수화된 파이프라인과 메모리 최적화 기능을 갖춘 Energon 공동 프로세서를 설계한다.
  • 다양한 워크로드와 코어 수에서의 성능 저하 원인을 분석하고 하드웨어 구성 가이드라인을 제공하기 위해 성능 모델을 구현한다.
  • 엔드 투 엔드 성능과 확장성을 평가하기 위해 Energon 가속기 기반의 엣지 및 서버 플랫폼(Energon-edge 및 Energon-server)에 통합한다.

실험 결과

연구 질문

  • RQ1런타임에 식별된 동적 스퍼스 어텐션은 정확도 손실이 크지 않은 상태에서 트랜스포머의 계산 복잡도를 줄일 수 있는가?
  • RQ2혼합 정밀도 다중 라운드 필터링 전략은 정밀도 오버헤드를 최소화하면서도 중요한 쿼리-키 쌍을 효과적으로 식별할 수 있는가?
  • RQ3Energon 공동 프로세서 아키텍처는 스퍼스 어텐션 워크로드에 대해 메모리 액세스와 파이프라인 효율성을 어떻게 최적화하는가?
  • RQ4다양한 NLP 및 CV 작업에서 Energon은 SpAtten 및 A³와 같은 최신 액셀러레이터보다 성능 및 에너지 효율성 측면에서 얼마나 뛰어나게 성능을 냈는가?
  • RQ5코어 수를 늘릴 경우 Energon의 확장성은 어떻게 되며, 성능 저하 요인은 어디에 존재하는가?

주요 결과

  • 클라우드 워크로드에서 Energon은 Intel Xeon 5220 CPU 대비 지오메트릭 평균 168배의 성능 향상과 10⁴배의 에너지 절감을 달성했으며, 엣지 플랫폼에서는 ARM-A72 CPU 대비 440배의 성능 향상과 2951배의 에너지 절감을 기록했다.
  • NLP 벤치마크에서 Energon은 NVIDIA V100 GPU 대비 최대 8.7배의 성능 향상과 10³배의 에너지 절감을 달성했으며, 성능 및 에너지 효율성 측면에서 SpAtten 및 A³를 모두 뛰어넘었다.
  • MP-MRF 알고리즘은 정확도 손실이 거의 없이 계산량을 4배에서 8배까지 줄였으며, 모델 재학습 없이도 동적 프루닝을 가능하게 했다.
  • Energon이 탑재된 시스템은 파이ipel라인된 어텐션 실행으로 인해 종단 간 지연이 1.21배 감소하고 처리량이 1.55배 향상되었다.
  • 확장성 분석 결과, 코어 수를 4개에서 16개로 늘일 경우 종단 간 지연이 크게 감소했지만, 16개 코어를 초과하면 메모리 대역폭 제약으로 인해 성능 향상이 정체되었다.
  • SpAtten 대비 Energon은 Task-A, C, D에서 각각 16배, 8배, 8배의 프루닝을 달성했으며, SpAtten는 재학습 없이도 2배의 프루닝에 그쳤다. 이는 더 뛰어난 희박성 및 정확도의 상호 보완성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.