Skip to main content
QUICK REVIEW

[논문 리뷰] Pixelated Butterfly: Simple and Efficient Sparse training for Neural Network Models

Tri Dao, Beidi Chen|arXiv (Cornell University)|2021. 11. 30.
Advanced Neural Network Applications참고 문헌 90인용 수 7
한 줄 요약

Pixelated Butterfly는 평탄한 블록 버터플라이 행렬과 저랭크 성분을 조합하여 신경망 레이어를 희소화하는 단순하고 하드웨어 친화적인 희소 학습 방법을 제안한다. 이는 블록 정렬된, 병렬 처리 가능한 계산을 가능하게 하여, 밀도 있는 모델인 Vision Transformer, GPT-2, MLP-Mixer보다 ImageNet 및 WikiText-103에서 최대 2.5배 빠른 학습 속도를 달성하면서 정확도 손실 없이 강력한 밀도 모델 근사성을 유지한다.

ABSTRACT

Overparameterized neural networks generalize well but are expensive to train. Ideally, one would like to reduce their computational cost while retaining their generalization benefits. Sparse model training is a simple and promising approach to achieve this, but there remain challenges as existing methods struggle with accuracy loss, slow training runtime, or difficulty in sparsifying all model components. The core problem is that searching for a sparsity mask over a discrete set of sparse matrices is difficult and expensive. To address this, our main insight is to optimize over a continuous superset of sparse matrices with a fixed structure known as products of butterfly matrices. As butterfly matrices are not hardware efficient, we propose simple variants of butterfly (block and flat) to take advantage of modern hardware. Our method (Pixelated Butterfly) uses a simple fixed sparsity pattern based on flat block butterfly and low-rank matrices to sparsify most network layers (e.g., attention, MLP). We empirically validate that Pixelated Butterfly is 3x faster than butterfly and speeds up training to achieve favorable accuracy--efficiency tradeoffs. On the ImageNet classification and WikiText-103 language modeling tasks, our sparse models train up to 2.5x faster than the dense MLP-Mixer, Vision Transformer, and GPT-2 medium with no drop in accuracy.

연구 동기 및 목표

  • 동적 희소성 마스크나 비정형 희소성에 의존하는 기존 희소 학습 방법의 비효율성과 높은 오버헤드를 해결한다.
  • 희소 행렬 연산에서의 하드웨어 비효율성을 해소하기 위해 희소성 패턴을 블록 최적화된 메모리 액세스와 정렬한다.
  • 특히 어텐션과 MLP 구성 요소에 적합한 다양한 신경망 레이어에 적용 가능한 통합된 정적 희소성 패턴을 개발한다.
  • 모델 정확도를 훼손하지 않으면서 과다 매개변수화된 모델에 대해 높은 학습 속도 향상을 달성한다.
  • 구현을 단순화하고 계산 오버헤드를 줄여 희소 학습의 실용적이고 광범위한 도입을 가능하게 한다.

제안 방법

  • 희소 행렬의 슈퍼셋 위에서 연속 최적화 프레임워크를 제안하여 희소성 마스크 탐색을 단순화한다.
  • 표준 버터플라이 행렬의 1차 근사로 평탄한 버터플라이 행렬을 도입하여 순차적 곱셈을 합으로 대체함으로써 더 나은 병렬화를 가능하게 한다.
  • 고정된, 하드웨어에 맞춘 희소성 패턴을 가진 블록 버터플라이 행렬을 설계하여 GPU에서의 메모리 액세스 효율성을 향상시킨다.
  • 평탄한 블록 버터플라이 행렬과 저랭크 성분을 조합하여 전역 및 국소적 특징 표현을 모두 포착한다.
  • 학습 전반에 걸쳐 정적 희소성 패턴을 사용하여 동적 마스크 업데이트가 필요 없고, 학습 오버헤드를 감소시킨다.
  • Transformer 및 MLP-Mixer 모델의 어텐션 및 MLP 레이어를 희소화하기 위해 이 방법을 적용하여 효율적이고 확장 가능한 학습을 가능하게 한다.

실험 결과

연구 질문

  • RQ1정적이고 하드웨어에 맞춘 희소성 패턴을 설계하여 희소 신경망에서 고속의 학습 효율성과 강력한 모델 정확도를 동시에 달성할 수 있는가?
  • RQ2다양한 신경망 아키텍처에서 평탄한 블록 버터플라이 행렬의 근사 오차는 밀도 있는 모델과 비교해 어떻게 되는가?
  • RQ3블록 정렬된 희소성 패턴을 사용한 희소 학습이 정확도 저하 없이 월클록 속도 측면에서 밀도 있는 학습을 얼마나 뛰어넘을 수 있는가?
  • RQ4통합된 희소성 패턴이 어텐션 레이어와 MLP 레이어와 같은 다양한 신경망 구성 요소에 효과적으로 일반화될 수 있는가?
  • RQ5버터플라이 구조와 저랭크 성분의 조합이 비정형 또는 표준 버터플라이 희소성보다 더 나은 근사성과 효율성을 제공하는가?

주요 결과

  • Pixelated Butterfly는 ImageNet 및 WikiText-103에서 Vision Transformer, GPT-2 미디엄, MLP-Mixer와 같은 밀도 모델보다 최대 2.5배 빠른 학습 속도를 달성하면서 정확도 손실 없이 성능을 유지한다.
  • 이 방법은 표준 버터플라이 행렬 학습보다 3배 빠르며, 하드웨어 활용도 향상과 병렬 처리 덕분이다.
  • 평탄한 버터플라이 행렬은 순차적 곱셈을 합으로 대체하여 효율적이고 병렬 처리 가능한 행렬 곱셈을 가능하게 한다.
  • 블록 버터플라이 행렬은 하드웨어 메모리 블록과 정렬되어 있어 메모리 액세스 효율성을 크게 향상시키고 지연을 감소시킨다.
  • 평탄한 블록 버터플라이와 저랭크 성분의 조합은 근사 정확도와 학습 속도 측면에서 다른 희소성 패턴보다 일관되게 뛰어나다.
  • 이 방법은 과다 매개변수화된 모델에서도 강력한 일반화 성능을 유지하며, 밀도 있는 네트워크에서 관찰되는 더블 디센트 행동을 지속한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.