Skip to main content
QUICK REVIEW

[논문 리뷰] INsight: A Neuromorphic Computing System for Evaluation of Large Neural Networks

Jaeyong Chung, Taehwan Shin|arXiv (Cornell University)|2015. 08. 05.
Advanced Memory and Neural Computing참고 문헌 16인용 수 11
한 줄 요약

이 논문은 저랭크 근사화를 통해 가중치를 압축하고, 이를 바탕으로 희박하게 연결된 시간지연 신경망(TDNN)을 현장 프로그래머블 게이트 어레이(FPGA)에 매핑함으로써 대규모 신경망의 에너지 효율적인 추론을 가능하게 하는 뉴모르픽 컴퓨팅 시스템 INsight를 제안한다. 이 시스템은 외부 메모리 없이 모든 가중치를 내장 메모리에 저장함으로써 비-바노이만, 저전력 동작을 실현하며, MNIST에서 97.64%의 정확도를 달성한다.

ABSTRACT

Deep neural networks have been demonstrated impressive results in various cognitive tasks such as object detection and image classification. In order to execute large networks, Von Neumann computers store the large number of weight parameters in external memories, and processing elements are timed-shared, which leads to power-hungry I/O operations and processing bottlenecks. This paper describes a neuromorphic computing system that is designed from the ground up for the energy-efficient evaluation of large-scale neural networks. The computing system consists of a non-conventional compiler, a neuromorphic architecture, and a space-efficient microarchitecture that leverages existing integrated circuit design methodologies. The compiler factorizes a trained, feedforward network into a sparsely connected network, compresses the weights linearly, and generates a time delay neural network reducing the number of connections. The connections and units in the simplified network are mapped to silicon synapses and neurons. We demonstrate an implementation of the neuromorphic computing system based on a field-programmable gate array that performs the MNIST hand-written digit classification with 97.64% accuracy.

연구 동기 및 목표

  • 대규모 신경망을 평가할 때 발생하는 높은 에너지 소비와 바노이만 아키텍처의 처리 병목 현상을 해결하기 위해.
  • 모든 가중치 매개변수를 내장 메모리에 저장하여 외부 메모리 액세스를 제거하는 뉴모르픽 시스템을 설계하기 위해.
  • FPGA 기반의 뉴모르픽 하드웨어를 활용해 깊은 신경망의 효율적이고 저전력의 추론을 가능하게 하기 위해.
  • 저랭크 근사화와 TDNN 변환을 통해 모델 파라미터를 극적으로 감소시키면서도 높은 분류 정확도를 유지하기 위해.
  • 컴파일러에서 마이크로아키텍처에 이르기까지 추론 워크로드에 특화된 완전한 통합 뉴모르픽 스택을 구현하기 위해.

제안 방법

  • 컴파일러는 훈련된 순방향 신경망을 연결성과 파라미터 수를 줄인 희박하게 연결된 시간지연 신경망(TDNN)으로 분해한다.
  • 가중치 행렬을 압축하기 위해 저랭크 근사화를 적용하여 정확도 손실를 최소화하면서 내장 메모리에 저장 가능하게 한다.
  • 단순화된 네트워크는 고유의 컴파일러와 FPGA 설계 프로세스를 통해 실리콘 시냅스와 디지털 스파iking 뉴런에 매핑된다.
  • 시스템은 외부 메모리를 완전히 회피하기 위해 내장 블록 램을 프레임 버퍼로 사용하여 비-바노이만 아키텍처를 실현한다.
  • 신경망 유닛과 지연 요소는 표준 집적회로 설계 도구를 사용해 자동으로 배치 및 루팅되며, 효율적인 하드웨어 매핑을 가능하게 한다.
  • 구현은 FPGA를 대상으로 하며, 최종 시스템은 이미지당 156.8 μs의 시간에 추론을 수행한다.

실험 결과

연구 질문

  • RQ1모든 가중치를 내장 메모리에 저장하여 외부 메모리 액세스를 피할 수 있는 뉴모르픽 시스템이 고정확도의 신경망 추론을 달성할 수 있는가?
  • RQ2저랭크 근사화와 TDNN 변환를 통해 얼마나 효과적으로 모델 파라미터를 감소시킬 수 있으며, 정확도 손실는 최소화할 수 있는가?
  • RQ3표준 FPGA 설계 방법론이 전체 스택 뉴모르픽 추론 시스템을 구현하는 데 얼마나 효과적으로 적용될 수 있는가?
  • RQ4비-바노이만 뉴모르픽 아키텍처는 임베디드 플랫폼에서 실시간, 저전력 추론을 달성할 수 있는가?
  • RQ5뉴모르픽 추론 시스템에서 파라미터 감소, 하드웨어 비용, 분류 정확도 사이의 상호 상충 관계는 어떠한가?

주요 결과

  • 뉴모르픽 시스템은 외부 메모리 없이 내장 메모리만을 사용하여 MNIST 데이터셋에서 97.64%의 분류 정확도를 달성했다.
  • 시스템은 각 입력 이미지를 156.8 μs 내에 처리하여 실시간 추론 능력을 입증했다.
  • 모든 가중치 매개변수(원래 네트워크의 109,760개)가 내장 메모리에 저장되어 외부 메모리 액세스가 완전히 제거되었다.
  • 컴파일러는 단일 레이어 네트워크에서 최대 9.52배, 더 깊은 아키텍처에서는 100배 이상의 파라미터 감소를 이룩했으며, 정확도 손실는 최소한으로 유지했다.
  • FPGA에 구현된 ConvNet2는 시뮬레이션 결과와 정확히 일치하여 기능 정확성이 확인되었다.
  • 이 방법은 더 큰 FPGA나 맞춤형 ASIC로의 확장이 가능하여, 내장 메모리에 400만 개 이상의 파라미터를 저장할 수 있는 네트워크 지원이 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.