Skip to main content
QUICK REVIEW

[논문 리뷰] Accelerating Sparse DNN Models without Hardware-Support via Tile-Wise Sparsity

Cong Guo, Bo Yang Hsueh|arXiv (Cornell University)|2020. 08. 29.
Tensor decomposition and applications참고 문헌 56인용 수 13
한 줄 요약

이 논문은 하드웨어 수정 없이 일반 GPU에서 희소 DNN의 효율적 추론을 가능하게 하는 소프트웨어 전용 정렬 방법인 타일 단위 희소성(TW)을 제안한다. GEMM 연산 내에서 타일 수준에서 규칙적인 희소성 패턴을 강제함으로써, 전역적으로 불규칙한 정렬을 통해 높은 모델 정확도를 유지하면서도 GPU 텐서 코어에서 밀도 있는 모델 대비 최대 1.95배의 성능 향상을 달성한다.

ABSTRACT

Network pruning can reduce the high computation cost of deep neural network (DNN) models. However, to maintain their accuracies, sparse models often carry randomly-distributed weights, leading to irregular computations. Consequently, sparse models cannot achieve meaningful speedup on commodity hardware (e.g., GPU) built for dense matrix computations. As such, prior works usually modify or design completely new sparsity-optimized architectures for exploiting sparsity. We propose an algorithm-software co-designed pruning method that achieves latency speedups on existing dense architectures. Our work builds upon the insight that the matrix multiplication generally breaks the large matrix into multiple smaller tiles for parallel execution. We propose a tiling-friendly "tile-wise" sparsity pattern, which maintains a regular pattern at the tile level for efficient execution but allows for irregular, arbitrary pruning at the global scale to maintain the high accuracy. We implement and evaluate the sparsity pattern on GPU tensor core, achieving a 1.95x speedup over the dense model.

연구 동기 및 목표

  • 임의의 희소성 패턴으로 인한 비정규적인 메모리 액세스로 인해 일반 하드웨어에서 희소 DNN의 성능이 저하되는 문제를 해결하기 위해.
  • 아키텍처적 수정 없이도 기존의 밀도 있는 GEMM 가속기(예: GPU 텐서 코어)에서 정렬된 DNN 모델을 효율적으로 가속화할 수 있도록 하기 위해.
  • 전역적으로 불규칙한 정렬을 允허하면서도 타일 수준에서 규칙성을 유지할 수 있는 타일 친화적인 희소성 패턴을 도입함으로써 모델 정확도와 실행 효율성의 균형을 맞추기 위해.
  • 특수화된 희소성 최적화 가속기 의존 없이도 소프트웨어 최적화만으로도 표준 하드웨어에서 상당한 성능 향상을 달성할 수 있음을 입증하기 위해.

제안 방법

  • 큰 행렬을 더 작은 타일로 나누어 GEMM 연산을 수행하며, 타일 수준에서 희소성을 강제함으로써 기존의 밀도 있는 GEMM 커널과의 호환성을 유지한다.
  • 각 타일 내에서 집합적 중요도 점수를 기반으로 행/열 정렬을 적용함으로써, 타일 수준에서는 규칙적인 계산 패턴을 유지하면서도 전역적으로는 임의의 희소성 패턴을 허용한다.
  • 타일 크기는 정확도와 효율성 사이의 트레이드오���을 제어한다: 더 작은 타일은 더 세밀한 정렬(원소 수준 희소성에 가까움)을 가능하게 하고, 더 큰 타일은 더 거친, 구조적 정렬을 강제한다.
  • 하이브리드 희소성 패턴은 TW 희소성 위에 원소 수준 정렬(가중치의 1.5%)을 겹쳐 적용하여 정확도를 더욱 향상시키며, 최소한의 오버헤드로도 가능하다.
  • 표준 GEMM 커널을 사용하여 GPU 텐서 코어에 구현되었으며, 기본적으로 전치 및 융합 최적화가 활성화되어 있다.
  • 이 방법은 GPU의 기존 동시성 및 메모리 액세스 패턴을 활용하여, 마이크로아키텍처나 저수준 프로그래밍 인터페이스의 변경 없이도 작동한다.

실험 결과

연구 질문

  • RQ1하드웨어 수정 없이도 일반 GPU에서 소프트웨어 전용 희소성 패턴을 설계하여 희소 DNN 추론을 가속화할 수 있는가?
  • RQ2어떻게 희소성 패턴을 구성하면 기존 GEMM 가속기에서 높은 모델 정확도를 유지하면서도 효율적인 실행을 가능하게 할 수 있는가?
  • RQ3표준 하드웨어에서 정확도와 성능의 균형을 고려할 때, 타일 크기와 희소성 패턴 사이의 최적의 트레이드오프는 무엇인가?
  • RQ4타일 단위와 원소 수준 희소성을 결합한 하이브리드 희소성 패턴은 최소한의 성능 비용으로 정확도를 추가로 향상시킬 수 있는가?

주요 결과

  • 제안된 타일 단위(TW) 희소성 패턴은 BERT 및 NMT 모델에서 75% 희소성 조건에서 정확도 저하가 3% 미만일 때 GPU 텐서 코어에서 밀도 있는 모델 대비 최대 1.95배의 성능 향상을 달성한다.
  • 동일한 희소성 및 정확도 조건에서 BERT와 NMT에 대해 각각 엔드 투 엔드 지연 시간이 1.61배와 1.86배 감소한다.
  • TW 희소성에 1.5%의 원소 수준 정렬을 추가한 하이브리드 희소성 패턴은 특히 불균형한 희소성 분포를 가진 모델에서 TW 전용 대비 모델 정확도를 크게 향상시킨다.
  • G=128의 타일 크기는 모델 정확도와 실행 효율성 사이의 유리한 균형을 제공하며, GEMM 하드웨어의 효과적 활용을 가능하게 한다.
  • 낮은 수준의 프로그래밍 인터페이스가 필요한 중간 크기의 GEMM 연산(예: 128×N×128)을 노출하는 경우, TPU와 같은 기존 플랫폼과도 호환된다.
  • 이 방법은 BERT 및 신경 기계 번역 모델을 포함한 다양한 DNN 모델에서 높은 성능을 유지하며, 광범위한 적용 가능성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.