Skip to main content
QUICK REVIEW

[논문 리뷰] Transformer Acceleration with Dynamic Sparse Attention

Liu Liu, Zheng Qu|arXiv (Cornell University)|2021. 10. 21.
Advanced Neural Network Applications참고 문헌 26인용 수 12
한 줄 요약

이 논문은 동적 희소 어텐션(Dynamic Sparse Attention, DSA)을 제안한다. DSA는 변동하는 입력에 따라 어텐션 패턴을 동적으로 식별하고 활용하여 계산 비용을 줄이되 모델 정확도를 손상시키지 않는 방법이다. 근사 어텐션 점수에 가벼운 예측 경로를 적용함으로써 DSA는 최대 95%의 희소성과 이론상 4.35배의 계산 감소를 달성하며, 오직 1.33%의 추가 오버헤드만을 유발한다. 이로 인해 V100 GPU에서 90% 희소성 조건 하에 어텐션 출력 계산에서는 1.94배, 소프트맥스 계산에서는 14.6배의 속도 향상을 기록한다.

ABSTRACT

Transformers are the mainstream of NLP applications and are becoming increasingly popular in other domains such as Computer Vision. Despite the improvements in model quality, the enormous computation costs make Transformers difficult at deployment, especially when the sequence length is large in emerging applications. Processing attention mechanism as the essential component of Transformer is the bottleneck of execution due to the quadratic complexity. Prior art explores sparse patterns in attention to support long sequence modeling, but those pieces of work are on static or fixed patterns. We demonstrate that the sparse patterns are dynamic, depending on input sequences. Thus, we propose the Dynamic Sparse Attention (DSA) that can efficiently exploit the dynamic sparsity in the attention of Transformers. Compared with other methods, our approach can achieve better trade-offs between accuracy and model complexity. Moving forward, we identify challenges and provide solutions to implement DSA on existing hardware (GPUs) and specialized hardware in order to achieve practical speedup and efficiency improvements for Transformer execution.

연구 동기 및 목표

  • 긴 시퀀스 길이에서 트랜스포머의 자기어텐션 계산 비용이 높다는 문제를 해결하기 위해.
  • 입력에 따라 변화하는 동적 희소성을 포착하지 못하는 정적 희소 어텐션 패턴의 한계를 극복하기 위해.
  • 전체 어텐션의 표현 능력을 유지하면서 계산을 줄이는 실용적이고 하드웨어 효율적인 방법을 개발하기 위해.
  • 동적 희소성과 데이터플로우 최적화를 통해 기존 및 전용 하드웨어에 대규모 트랜스포머의 효율적 구현을 가능하게 하기 위해.

제안 방법

  • 표준 자기어텐션에 가벼운 예측 경로를 추가하여 어텐션 점수 내의 동적 희소 패턴을 식별하기 위해.
  • 계산 오버헤드를 줄이기 위해 저비용 근사 어텐션 점수를 희소성 예측기의 입력으로 사용하기 위해.
  • 예측된 희소성을 학습 가능한 이진 마스크로 표현하여 소프트맥스 및 출력 계산에서 불필요한 연산을 건너뛰기 위해.
  • 하드웨어 최적화를 위해 세분화된 동적 희소성 패턴을 블록 단위 및 벡터 단위 희소성과 같은 구조적 패턴으로 확장하기 위해.
  • GPU 및 전용 가속기에서 메모리 접근 효율성을 향상시키기 위해 맞춤형 커널 설계와 데이터 재사용 기회를 활용하기 위해.
  • 희소성 예측을 위한 저정밀도 추론을 통합하고, 계산 재정렬을 통해 토큰 단위 병렬 처리를 가능하게 하기 위해.

실험 결과

연구 질문

  • RQ1자기어텐션 내의 동적 희소 패턴을 효과적으로 식별하고 활용하여 정확도 손실 없이 계산을 줄일 수 있는가?
  • RQ2정적 또는 고정된 희소 패턴과 비교해 동적 희소성의 정확도 및 효율성 간의 상호 교환 관계는 어떠한가?
  • RQ3DSA는 기존 GPU 아키텍처와 전용 하드웨어 가속기에서 실제로 얼마나 높은 성능 향상을 기대할 수 있는가?
  • RQ4알고리즘적 희소성과 하드웨어를 공동 설계함으로써 최대의 속도 향상과 에너지 효율성을 달성할 수 있는가?

주요 결과

  • DSA는 LRA 벤치마크에서 모델 정확도에 미치는 영향을 감지할 수 없을 정도로 최대 95%의 희소성을 달성한다.
  • 희소성 예측으로 인한 추가 계산 오버헤드는 1.17%에서 1.33% 사이로 매우 낮으며, 이로 인해 이론상 4.35배의 계산 감소가 가능하다.
  • NVIDIA V100 GPU에서 DSA는 90% 희소성 조건 하에 어텐션 점수 계산에서 1.15배, 소프트맥스 계산에서 14.6배, 어텐션 출력 계산에서 1.94배의 속도 향상을 기록한다.
  • 벡터 단위 희소성과 최적화된 커널 설계를 통해 DSA는 전용 하드웨어에서 총 메모리 접근 횟수를 최대 2.54배 줄였다.
  • 낮은 랭크 근사나 과도한 프루닝과 달리, 중요한 어텐션 가중치를 유지함으로써 전체 어텐션의 표현 능력을 그대로 유지한다.
  • 하드웨어 특화 설계를 통해 저정밀도 예측, 세분화된 희소 계산, 향상된 데이터 국소성 등을 통해 추가적인 성능 향상을 달성할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.