[논문 리뷰] Dynamic Sparse Training with Structured Sparsity
이 논문은 일정한 팬인 제약 조건을 갖는 미세한 구조적 N:M 희소성(구조적 희소성)을 학습하는 동적 희소 학습 방법인 Structured RigL(SRigL)을 제안한다. 이는 일반화 성능이 비구조적 동적 희소 학습과 유사한 수준을 유지하면서도 높은 모델 희소성과 함께 실세계에서의 추론 속도 향상을 가능하게 한다. SRigL은 구조적 희소성과 뉴런 제거를 조합하여 GPU에서 최대 13.0×, CPU에서 최대 3.4×의 실세계 추론 속도 향상을 달성하며, 밀집 모델 및 비구조적 희소 기반 모델을 모두 능가한다.
Dynamic Sparse Training (DST) methods achieve state-of-the-art results in sparse neural network training, matching the generalization of dense models while enabling sparse training and inference. Although the resulting models are highly sparse and theoretically less computationally expensive, achieving speedups with unstructured sparsity on real-world hardware is challenging. In this work, we propose a sparse-to-sparse DST method, Structured RigL (SRigL), to learn a variant of fine-grained structured N:M sparsity by imposing a constant fan-in constraint. Using our empirical analysis of existing DST methods at high sparsity, we additionally employ a neuron ablation method which enables SRigL to achieve state-of-the-art sparse-to-sparse structured DST performance on a variety of Neural Network (NN) architectures. Using a 90% sparse linear layer, we demonstrate a real-world acceleration of 3.4x/2.5x on CPU for online inference and 1.7x/13.0x on GPU for inference with a batch size of 256 when compared to equivalent dense/unstructured (CSR) sparse layers, respectively.
연구 동기 및 목표
- 표준 하드웨어에서 비구조적 희소 신경망을 사용할 때 실세계 추론 가속화를 달성하는 데 도전하는 문제를 해결하기 위해.
- 고 희소성 수준에서 비구조적 동적 희소 학습과 유사한 일반화 성능을 유지하는 동시에, 희소에서 희소로의 동적 학습 방법을 개발하기 위해.
- 일정한 팬인과 뉴런 제거를 통한 구조적 희소성 구현을 통해 파rameter 효율성과 하드웨어 우수한 희소성 패턴을 동시에 확보하기 위해.
- 동적 학습을 통해 학습된 구조적 희소성이 고도로 효율적인 모델 성능과 함께 CPU 및 GPU에서 실질적인 가속화를 가능하게 함을 보여주기 위해.
- 구조적 희소성이 뉴런 제거와 함께 조합될 경우 모델 정확도를 훼손하지 않으면서도 추론 효율성을 향상시킬 수 있음을 보여주기 위해.
제안 방법
- SRigL는 RigL 동적 희소 학습 프레임워크를 확장하여 각 뉴런이 일정한 수의 비영인 입력 가중치를 유지하도록 보장하는 일정한 팬인 제약 조건을 도입한다.
- 이 방법은 N개의 비영인 가중치를 갖는 M개의 연속된 가중치로 이루어진 구조적 N:M 희소성 패턴을 학습함으로써, 압축되고 하드웨어 최적화된 표현 방식을 가능하게 한다.
- 모든 희소성 수준에서 뉴런 제거가 통합되어, 기여도가 낮은 뉴런을 동적으로 제거할 수 있도록 한다.
- 새로운 경험적 분석 결과, 비구조적 DST 방법인 RigL는 90% 이상의 희소성 수준에서 전체 뉴런을 제거함을 확인하였으며, 이는 SRigL에 뉴런 제거를 통합할 근거를 제공한다.
- 구조적 희소성 패턴은 학습 기간 동안 엔드 투 엔드로 학습되며, 기울기 크기와 팬인 제약 조건에 따라 가중치 제거 및 재생이 이뤄진다.
- 희소 가중치 행렬의 압축된 표현 방식을 사용하여 CPU 및 GPU 모두에서 효율적인 저장 및 계산을 가능하게 한다.

실험 결과
연구 질문
- RQ1비구조적 희소 신경망을 위한 실세계 하드웨어 가속화를 달성하면서도 일반화 성능을 유지하는 동적 희소 학습을 구조적 희소성 패턴 학습에 적응시킬 수 있는가?
- RQ2고 희소성 수준에서 구조적 희소성과 함께 뉴런 제거가 모델 성능과 효율성에 어떤 영향을 미치는가?
- RQ3구조적 희소성에 일정한 팬인 제약 조건을 적용할 경우, 비구조적 희소성 대비 출력 노름 분산이 더 안정적이고 예측 가능해지는가?
- RQ4동적 학습을 통해 학습된 구조적 희소성이 CPU 및 GPU에서 실세계 추론 벤치마크에서 비구조적 희소성보다 얼마나 뛰어나게 성능을 높일 수 있는가?
- RQ5일정한 팬인과 뉴런 제거를 갖는 구조적 희소성이 모델 정확도를 훼손하지 않으면서도 추론 속도 향상에 상호 보완적으로 기여하는가?
주요 결과
- SRigL는 다양한 아키텍처에서 비구조적 RigL의 일반화 성능을 99% 희소성까지 그대로 유지하며, 희소에서 희소로의 구조적 동적 훈련 분야에서 최신 기술 수준을 달성한다.
- CPU에서는 90% 희소성에서 온라인 추론 시 3.4×, 배치 추론 시 2.5×의 속도 향상을 달성하며, 동일한 밀집 레이어와 비교해도 유의미한 성능 향상을 보였다.
- GPU에서는 온라인 추론 시 1.7×의 속도 향상을, 배치 크기가 256인 배치 추론 시에는 비구조적 CSR 희소 레이어 대비 13.0×의 속도 향상을 기록하였다.
- 일정한 팬인 제약 조건은 출력 노름 분산을 감소시켜 고 희소성 조건에서도 더 안정적이고 예측 가능한 모델 행동을 가능하게 하였다.
- SRigL에서의 뉴런 제거 기능은 중요한 뉴런을 유지함으로써 극단적 희소성(예: 99%)에서도 더 나은 성능을 달성하였으며, 핵심 가중치의 제거를 방지하였다.
- 구조적 희소성과 뉴런 제거의 조합은 메모리 효율적인 표현을 가능하게 하여, 파rameter 효율성과 실세계 하드웨어에서의 고속 가속화를 동시에 확보하였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.