Skip to main content
QUICK REVIEW

[논문 리뷰] SparseRT: Accelerating Unstructured Sparsity on GPUs for Deep Learning Inference

Ziheng Wang|arXiv (Cornell University)|2020. 08. 26.
Advanced Neural Network Applications참고 문헌 42인용 수 8
한 줄 요약

SparseRT는 지정된 GPU 하드웨어에서 비구조적 희박성의 딥러닝 추론을 가속화하기 위해 인spect러-실행자 프레임워크를 활용하여 희박 행렬-밀도 행렬 곱셈(SpMM)을 최적화하는 코드 생성기입니다. 1x1 컨볼루션과 풀커넥티드 레이어에서 90% 희박성일 경우 기하평균 3.4배, 95% 희박성일 경우 5.4배의 가속을 달성하여, 일반적인 GPU에서 비구조적 희박성이 효율적으로 활용될 수 있음을 보여줍니다.

ABSTRACT

In recent years, there has been a flurry of research in deep neural network pruning and compression. Early approaches prune weights individually. However, it is difficult to take advantage of the resulting unstructured sparsity patterns on modern hardware like GPUs. As a result, pruning strategies which impose sparsity structures in the weights have become more popular. However,these structured pruning approaches typically lead to higher losses in accuracy than unstructured pruning. In this paper, we present SparseRT, a code generator that leverage unstructured sparsity to accelerate sparse linear algebra operations in deep learning inference on GPUs. For 1x1 convolutions and fully connected layers, we demonstrate geometric mean of speedups of 3.4x over the equivalent dense computation at 90% sparsity and 5.4x at 95% sparsity when evaluated on hundreds of test cases in deep learning. For sparse 3x3 convolutions, we show speedups of over 5x on use cases in ResNet-50.

연구 동기 및 목표

  • 현대 GPU 하드웨어에서 비구조적 희박성이 잘 지원되지 않는다는 기존의 믿음을 도전하기 위해.
  • 기존 SpMM 구현이 과도하게 희박한 과학 계산에 최적화되어 있어 딥러닝의 성능 저하 문제를 해결하기 위해.
  • 일반적인 GPU 아키텍처를 사용하여 희박화된 딥 네URAL 네트워크의 효율적 추론을 가능하게 하기 위해.
  • 맞춤형 최적화 커널과 함께 사용할 경우 비구조적 프루닝이 정확하고 성능이 뛰어나다는 것을 입증하기 위해.

제안 방법

  • SparseRT는 인спект러-실행자 프레임워크를 사용하여 희박성 패턴을 분석하고 SpMM 연산을 위한 최적화된 PTX 커널을 생성합니다.
  • 밀도 행렬 곱셈에서 시작하여 희박성 패턴에 기반해 불필요한 계산을 제거함으로써 복잡한 희박 형식에 의존하지 않습니다.
  • 각 레이어의 희박성 구조에 맞게 맞춤형 CUDA 커널을 PTX 코드 생성 백엔드를 통해 생성합니다.
  • 희박한 3x3 컨볼루션은 im2col 기법을 사용하여 SpMM로 변환함으로써 가속화됩니다.
  • 실제 컴퓨터 비전 및 NLP 분야의 프루닝된 모델(예: ResNet-50 및 BERT 유사 아키텍처)을 대상으로 평가합니다.
  • 일반화를 확보하기 위해 수백 개의 테스트 케이스에서 다양한 희박성 수준(90% 및 95%)에서 성능을 측정합니다.

실험 결과

연구 질문

  • RQ1일반적인 GPU에서 특수 하드웨어 없이 비구조적 희박성을 효율적으로 가속화할 수 있는가?
  • RQ2딥러닝 추론 워크로드에서 인спект러-실행자 기반 코드 생성 기법이 SpMM에 얼마나 효과적인가?
  • RQ3실용적인 희박성 수준(예: 90–95%)에서 비구조적 희박성으로부터 기대할 수 있는 성능 향상은 어느 정도인가?
  • RQ4SpMM 최적화가 프루닝된 네트워크에서 1x1 컨볼루션과 풀커넥티드 레이어의 추론 속도를 얼마나 향상시킬 수 있는가?
  • RQ5희박한 컨볼루션 연산은 최소한의 성능 손실로 SpMM로 효과적으로 축소될 수 있는가?

주요 결과

  • SparseRT는 1x1 컨볼루션과 풀커넥티드 레이어에서 90% 희박성일 경우 밀도 계산 대비 기하평균 3.4배의 가속을 달성합니다.
  • 95% 희박성일 경우 기하평균 가속도는 5.4배로 증가하여 더 높은 희박성에서의 우수한 스케일러빌리티를 입증합니다.
  • ResNet-50의 희박한 3x3 컨볼루션에서는 SpMM로 변환함으로써 최대 4배의 가속을 달성합니다.
  • 컴퓨터 비전 및 NLP 분야의 실제 프루닝된 모델에서 수백 개의 테스트 행렬에 걸쳐 일관된 성능 향상이 관찰되었습니다.
  • 결과는 비구조적 희박성이 일반적인 GPU 아키텍처와 호환되지 않는다는 일반적인 가정을 도전합니다.
  • 적절한 코드 생성과 최적화를 통해 비구조적 희박성은 효율적인 딥러닝 추론을 위한 실현 가능한 길이 될 수 있음을 보여줍니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.