Skip to main content
QUICK REVIEW

[논문 리뷰] Group Scissor: Scaling Neuromorphic Computing Design to Large Neural Networks

Yandan Wang, Wei Wen|arXiv (Cornell University)|2017. 02. 11.
Advanced Memory and Neural Computing인용 수 7
한 줄 요약

이 논문은 심층 신경망을 위한 네우로모픽 컴퓨팅 시스템(NCS)의 확장성을 높이기 위해 크로스바 면적과 루팅 혼잡도를 줄이는 이단계 프레임워크인 Group Scissor를 제안한다. 랭크 클리핑은 저랭크 근사법을 사용해 가중치 행렬을 축소하고, 그룹 연결 삭제는 전체 연결 그룹을 구조적으로 프루닝하여 LeNet에서 정확도 손실 없이 크로스바 면적 13.62%와 루팅 면적 8.1% 감소를 달성했으며, ConvNet에서는 각각 51.81%와 52.06% 감소를 기록했다.

ABSTRACT

Synapse crossbar is an elementary structure in Neuromorphic Computing Systems (NCS). However, the limited size of crossbars and heavy routing congestion impedes the NCS implementations of big neural networks. In this paper, we propose a two-step framework (namely, group scissor) to scale NCS designs to big neural networks. The first step is rank clipping, which integrates low-rank approximation into the training to reduce total crossbar area. The second step is group connection deletion, which structurally prunes connections to reduce routing congestion between crossbars. Tested on convolutional neural networks of LeNet on MNIST database and ConvNet on CIFAR-10 database, our experiments show significant reduction of crossbar area and routing area in NCS designs. Without accuracy loss, rank clipping reduces total crossbar area to 13.62\% and 51.81\% in the NCS designs of LeNet and ConvNet, respectively. Following rank clipping, group connection deletion further reduces the routing area of LeNet and ConvNet to 8.1\% and 52.06\%, respectively.

연구 동기 및 목표

  • 대규모 심층 신경망(DNN)을 구현하는 데 있어 네우로모픽 컴퓨팅 시스템(NCS)의 확장성 한계를 해결한다.
  • NCS 설계에서 제한된 크로스바 크기와 심각한 루팅 혼잡도로 인한 하드웨어 병목 현상을 극복한다.
  • 현대 DNN용 효율적이고 정확하며 확장 가능한 NCS 구현을 가능하게 하는 소프트웨어-하드웨어 공동 설계 프레임워크를 개발한다.
  • 모델 정확도를 훼손하지 않으면서 크로스바 및 루팅 면적을 크게 감소시킨다.

제안 방법

  • 각 행렬 W ≈ U·V^T를 낮은 랭크 K로 근사하여 크로스바 치수를 최소화하는 방식으로, 가중치 행렬에 저랭크 근사(LRA)를 그룹 단위로 적용한다.
  • 학습 과정에 랭크 클리핑을 통합하여 모델 정확도를 유지하면서 필요한 시냅스 크로스바 수를 줄인다.
  • 전체 연결 그룹에 그룹 로지스틱 정규화를 적용하여 그룹 연결 삭제를 구현함으로써 가중치 행렬 전반에 걸쳐 구조적 희소성을 유도한다.
  • 계층적 MBC(메모리스터 기반 크로스바) 선택 전략을 적용: 크기가 ≤64×64인 경우 단일 MBC를 사용하고, 더 큰 행렬의 경우 다수의 MBC를 타일링하여 하드웨어 실현 가능성을 확보한다.
  • MBC 치수와 배선 수를 기반으로 수학적 공식을 사용해 크로스바 및 루팅 면적을 추정하며, 루팅 면적은 남은 배선 수의 기능으로 계산한다.
  • 프루닝 후 모든 열/행이 0이 되면 전체 크로스바를 제거하고 희소 크로스바를 더 작은 조밀한 크로스바로 대체함으로써 하드웨어 효율성을 최적화한다.

실험 결과

연구 질문

  • RQ1학습 과정에 저랭크 근사법을 효과적으로 통합하여 정확도 저하 없이 네우로모픽 하드웨어에서 크로스바 면적을 줄일 수 있는가?
  • RQ2그룹 연결 삭제를 통한 구조적 프루닝이 대규모 DNN에서 크로스바 간 루팅 혼잡도를 상당히 줄일 수 있는가?
  • RQ3조합된 Group Scissor 프레임워크는 모델 정확도를 유지하면서 총 하드웨어 면적(크로스바 + 루팅)을 얼마나 줄일 수 있는가?
  • RQ4표준 벤치마크(MNIST, CIFAR-10)와 하드웨어 인식 제약 조건 하에서, LeNet 및 ConvNet과 같은 실제 DNN에서 이 프레임워크는 어떻게 성능을 발휘하는가?

주요 결과

  • 랭크 클리핑은 LeNet에서 총 크로스바 면적을 원래의 13.62%로 줄였고, ConvNet에서는 51.81%로 감소시켰으며 정확도 손실 없음.
  • 그룹 연결 삭제는 LeNet에서 평균 레이어별 루팅 면적을 8.1%로 줄였고, 정확도 기준선을 유지함.
  • 단지 1.5%의 정확도 손실을 감수함으로써, LeNet의 레이어별로 루팅 면적이 각각 56.25%, 7.64%, 21.44%, 31.64%로 감소하여 경미한 정확도 희생 하에 강력한 확장성을 입증함.
  • 그룹 프루닝에 의해 유도된 구조적 희소성 덕분에 전체 크로스바 제거 및 더 작은 조밀한 크로스바로의 교체가 가능해져 면적을 추가로 감소시킴.
  • 그룹 연결 삭제 후 가중치 행렬은 전체 열/행이 0으로 설정된 블록 단위 희소성 구조를 보였고, 이에 따라 해당 루팅 배선을 제거할 수 있었음.
  • 이 프레임워크는 상당한 하드웨어 면적 절감을 달성했으며, LeNet에서 루팅 면적 최대 92% 감소를 기록했고, MNIST 및 CIFAR-10에서 최신 기술 수준의 성능을 유지함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.