Skip to main content
QUICK REVIEW

[논문 리뷰] Accelerating Framework of Transformer by Hardware Design and Model Compression Co-Optimization

Panjie Qi, Edwin H.‐M. Sha|arXiv (Cornell University)|2021. 10. 19.
Advanced Data Compression Techniques인용 수 4
한 줄 요약

이 논문은 계층적 프루닝(Hierarchical Pruning, HP)과 FPGA 전용 하드웨어 가속을 통해 모델 압축을 공동으로 설계함으로써 Transformer 추론을 공동 최적화하는 하드웨어-소프트웨어 프레임워크를 제안한다. 이 프레임워크는 지연(latency)과 정확도 제약 조건에 따라 최적의 장치를 자동으로 선택하며, CPU 대비 최대 37배의 속도 향상과 GPU 대비 1.9배의 성능 향상을 달성한다. 또한 높은 희박성(최대 98%)을 유지하면서도 고도로 효율적인 메모리 사용을 위한 맞춤형 희소 행렬 저장 방식을 통해 성능을 극대화한다.

ABSTRACT

State-of-the-art Transformer-based models, with gigantic parameters, are difficult to be accommodated on resource constrained embedded devices. Moreover, with the development of technology, more and more embedded devices are available to run a Transformer model. For a Transformer model with different constraints (tight or loose), it can be deployed onto devices with different computing power. However, in previous work, designers did not choose the best device among multiple devices. Instead, they just used an existing device to deploy model, which was not necessarily the best fit and may lead to underutilization of resources. To address the deployment challenge of Transformer and the problem to select the best device, we propose an algorithm & hardware closed-loop acceleration framework. Given a dataset, a model, latency constraint LC and accuracy constraint AC, our framework can provide a best device satisfying both constraints. In order to generate a compressed model with high sparsity ratio, we propose a novel pruning technique, hierarchical pruning (HP). We optimize the sparse matrix storage format for HP matrix to further reduce memory usage for FPGA implementation. We design a accelerator that takes advantage of HP to solve the problem of concurrent random access. Experiments on Transformer and TinyBert model show that our framework can find different devices for various LC and AC, covering from low-end devices to high-end devices. Our HP can achieve higher sparsity ratio and is more flexible than other sparsity pattern. Our framework can achieve 37x, 1.9x, 1.7x speedup compared to CPU, GPU and FPGA, respectively.

연구 동기 및 목표

  • 자원이 제한된 임베디드 장치에서 다양한 성능 요구 사양을 충족시키며 대규모 Transformer 모델을 구현하는 데 도전하는 것.
  • 기존의 순차적 설계 흐름이 모델 압축과 하드웨어 선택을 공동 최적화하지 못하는 비효율성을 해결하는 것.
  • 사용자가 지정한 지연(latency)과 정확도 제약 조건에 기반해 다양한 하드웨어 플랫폼(예: FPGA, 모바일 장치) 중에서 자동으로 최적의 장치를 선택할 수 있도록 하는 것.
  • 효율적인 희소 행렬 저장 및 하드웨어 매핑을 지원하는 고희박성, 유연한 프루닝 방법(계층적 프루닝)을 개발하는 것.
  • HP의 희박성 패턴을 활용하여 메모리 액세스 오버헤드를 줄이고 처리량을 향상시키는 하드웨어 가속기 설계

제안 방법

  • 사용자가 정의한 지연(LC) 및 정확도(AC) 제약 조건 하에서 모델 희박성과 하드웨어 배포를 공동 최적화하는 알고리즘 ⇄ 하드웨어 닫힌 루프 프레임워크를 제안한다.
  • 다양한 레이어 간 블록 수준의 희박성 패턴을 유연하게 지원하는 새로운 구조적 프루닝 기법인 계층적 프루닝(Hierarchical Pruning, HP)을 도입한다.
  • HP 희박성 패턴에 최적화된 맞춤형 희소 행렬 저장 형식을 설계하여 FPGA에서의 메모리 프로파일을 최소화한다.
  • 동시 다중 랜덤 액세스를 지원하는 전용 FPGA 가속기를 개발하여 메모리 대역폭 활용도를 향상시킨다.
  • LC 및 AC 제약 조건을 기반으로 스파arsity 비율과 장치 구성의 탐색 공간을 탐색하기 위해 강화 학습(Reinforcement Learning, RL)을 활용한다.
  • CPU, GPU, FPGA 플랫폼 간 성능 평가 및 비교를 위해 FLOPS와 자원 활용도를 메트릭으로 사용한다.

실험 결과

연구 질문

  • RQ1특정 지연 및 정확도 제약 조건 하에서 Transformer 모델을 구현하기 위한 최적의 하드웨어 플랫폼은 무엇인가?
  • RQ2모델 압축과 하드웨어 가속을 공동 설계함으로써 추론 속도와 자원 활용도를 극대화할 수 있는가?
  • RQ3계층적 프루닝 전략은 기존의 구조적 프루닝 방법보다 더 높은 희박성 비율을 달성하면서도 정확도를 유지할 수 있는가?
  • RQ4제안된 희소 저장 형식은 FPGA에서 메모리 사용을 어떻게 줄이고 성능을 향상시키는가?
  • RQ5프레임워크는 다양한 플랫폼(예: ZCU102, Alveo U200)에서 구성된 이질적인 장치 세트 중에서 사용자 제약 조건에 따라 최적의 장치를 자동으로 선택할 수 있는가?

주요 결과

  • 프레임워크는 ZCU102와 같은 저성능 FPGA부터 Alveo U200와 같은 고성능 장치에 이르기까지 다양한 임베디드 플랫폼에서 다양한 LC 및 AC 제약 조건에 적합한 최적의 장치를 성공적으로 식별한다.
  • 계층적 프루닝은 기존의 VW와 같은 방법이 가진 90%의 희박성 한계를 뛰어넘어 최대 98%의 희박성 비율을 달성하며, 고희박성 수준에서도 정확도 유지가 뛰어나다.
  • FPGA 가속기는 CPU 대비 37배, GPU 대비 1.9배, 이전의 FPGA 구현(FTRANS) 대비 1.7배의 성능 향상을 보이며 뛰어난 효율성을 입증한다.
  • 같은 제약 조건(예: 50ms, 80% 정확도) 하에서, 프레임워크는 모델 압축을 통해 저성능 FPGA(ZCU102)로도 매핑할 수 있어 다양한 응용 시나리오에서의 재사용을 가능하게 한다.
  • RL 기반 탐색은 목표 제약 조건(26ms, 96%) 근처에 해를 집중시키며, 자원 활용도를 타이브레이크 기준으로 사용해 가장 비용 효율적인 장치를 선별한다.
  • 희박성 비율이 88%일 경우, 40% 백본 모델이 96.4%의 정확도를 달성하며, 60% 및 70% 백본 희박성 모델보다 뛰어난 성능을 보이며, 높은 압축 수준에서도 초기 희박성 비율이 낮을수록 정확도 유지가 더 우수함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.