Skip to main content
QUICK REVIEW

[논문 리뷰] Computation on Sparse Neural Networks: an Inspiration for Future Hardware

Fei Sun, Minghai Qin|ArXiv.org|2020. 04. 24.
Advanced Neural Network Applications참고 문헌 85인용 수 5
한 줄 요약

이 논문은 향후 AI 하드웨어의 기초적 접근으로 희소 신경망을 주장하며, '가중치 지배' 영역에 있는 대규모 희소 모델이 동일한 FLOP 수준에서 밀도 있는 모델보다 성능이 뛰어나다고 주장한다. 이는 알고리즘, 소프트웨어, 전용 하드웨어를 공동 설계하여 희소 학습과 추론을 가속화함으로써, 영상, NLP, 그래프 학습과 같은 복잡한 AI 문제의 효율적 탐색을 가능하게 한다.

ABSTRACT

Neural network models are widely used in solving many challenging problems, such as computer vision, personalized recommendation, and natural language processing. Those models are very computationally intensive and reach the hardware limit of the existing server and IoT devices. Thus, finding better model architectures with much less amount of computation while maximally preserving the accuracy is a popular research topic. Among various mechanisms that aim to reduce the computation complexity, identifying the zero values in the model weights and in the activations to avoid computing them is a promising direction. In this paper, we summarize the current status of the research on the computation of sparse neural networks, from the perspective of the sparse algorithms, the software frameworks, and the hardware accelerations. We observe that the search for the sparse structure can be a general methodology for high-quality model explorations, in addition to a strategy for high-efficiency model execution. We discuss the model accuracy influenced by the number of weight parameters and the structure of the model. The corresponding models are called to be located in the weight dominated and structure dominated regions, respectively. We show that for practically complicated problems, it is more beneficial to search large and sparse models in the weight dominated region. In order to achieve the goal, new approaches are required to search for proper sparse structures, and new sparse training hardware needs to be developed to facilitate fast iterations of sparse models.

연구 동기 및 목표

  • 시각, NLP, 추천 시스템 등에서 현대 AI 모델의 증가하는 계산 요구를 해결한다.
  • 정확도를 훼손하지 않고도 계산을 줄일 수 있도록 희소성을 활용하여 하드웨어의 한계를 극복한다.
  • 큰 모델을 양품화하는 것에서 벗어나 직접 희소 모델을 훈련함으로써 더 빠른 반복과 확장성을 확보한다.
  • 복잡한 모델에서 높은 희소성 수준(90–99%)을 지원하기 위해 새로운 희소 학습 하드웨어 및 소프트웨어 스택을 개발한다.
  • 다양한 AI 도메인 전반에서 모델 탐색을 위한 첫 번째 방법론으로 희소성을 정착시킨다.

제안 방법

  • 파라미터 수와 아키텍처에 따라 모델 성능을 '가중치 지배' 영역과 '구조 지배' 영역으로 분류한다.
  • 가중치 지배 영역 내 대규모 희소 모델이 동일한 FLOP 수준에서 밀도 있는 모델보다 더 높은 정확도를 달성한다고 제안한다.
  • 동적 희소성, 희소 활성화, 텐서 분해와 같은 구조적 희소성 기법을 사용하여 계산을 줄인다.
  • 영역이 0인 연산을 건너뛰고 희소 가중치 및 활성화에 대한 메모리 액세스를 최적화하는 하드웨어 가속기(예: EIE, Cnvlutin, SIGMA)를 설계한다.
  • 메모리 오버헤드를 줄이고 처리량을 향상시키기 위해 유연한 라우팅과 높은 PE 활용도를 갖춘 희소 학습 플랫폼을 개발한다.
  • 알고리즘, 소프트웨어(예: 희소 라이브러리) 및 하드웨어 간의 공동 설계 원칙을 적용하여 희소 모델의 학습 및 추론을 가속화한다.

실험 결과

연구 질문

  • RQ1동일한 FLOP 예산 내에서 희소 신경망이 밀도 있는 모델보다 더 높은 정확도를 달성할 수 있는가?
  • RQ2복잡한 AI 작업에서 큰 희소 모델을 직접 훈련하는 것이 더 큰 밀도 있는 모델에서의 프루닝보다 더 효과적인 이유는 무엇인가?
  • RQ3대규모 희소 학습을 효율적으로 지원하기 위해 하드웨어 가속기는 어떻게 아키텍처화되어야 하는가?(예: 90–99% 희소성)
  • RQ4시각, NLP, 추천 등 다양한 AI 도메인에서 희소성이 일반적인 모델 탐색 방법론으로서 수행하는 역할은 무엇인가?
  • RQ5소프트웨어 프레임워크와 하드웨어 가속기를 어떻게 공동 설계하여 희소 모델에 대한 신속한 반복을 가능하게 할 수 있는가?

주요 결과

  • 가중치 지배 영역에서는 동일한 FLOPs 수치에서 희소 모델이 밀도 있는 모델보다 유의미하게 높은 정확도를 달성한다.
  • 기존의 큰 밀도 있는 모델에서의 프루닝은 복잡한 문제에 최적의 희소 구조를 생성하지 못하므로, 직접적인 희소 모델 훈련이 필요하다.
  • EIE, Cnvlutin, SIGMA와 같은 하드웨어 가속기는 0 연산을 건너뛰고 메모리 액세스 오버헤드를 줄여 추론 효율성을 향상시킨다.
  • 높은 PE 활용도와 유연한 라우팅(예: SIGMA의 128×128 Flex-DPE)을 갖춘 희소 학습 하드웨어는 대규모 희소 모델의 효율적 훈련을 가능하게 한다.
  • 동적 희소성과 구조적 희소성 메커니즘은 입력 유사성과 활성화 패턴을 활용하여 계산과 에너지 소비를 줄인다.
  • 희소 신경망의 향후 AI 워크로드 잠재력을 극대화하기 위해 알고리즘, 소프트웨어, 하드웨어의 공동 설계가 필수적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.