Skip to main content
QUICK REVIEW

[논문 리뷰] 5 Parallel Prism: A topology for pipelined implementations of convolutional neural networks using computational memory

Martino Dazzi, Abu Sebastian|arXiv (Cornell University)|2019. 06. 08.
Advanced Memory and Neural Computing참고 문헌 22인용 수 8
한 줄 요약

이 논문은 계산 메모리 어레이를 위한 통신 패브릭으로서 5개의 평행 프리즘(5PP) 구조를 제안하며, 최소한의 지연과 대역폭 오버헤드로 컨volutional 신경망(CNN)의 파ipel라인 추론을 가능하게 한다. CNN의 그래프 표현과 5PP 사이의 호모모르피즘을 증명함으로써, 저자들은 ResNet, Inception, DenseNet을 포함한 모든 주요 CNN 아키텍처가 효율적으로 매핑될 수 있음을 입증하며, 2D 메시 대비 최대 7배 낮은 지연과 채널당 최대 4배 감소한 대역폭을 달성한다.

ABSTRACT

In-memory computing is an emerging computing paradigm that could enable deeplearning inference at significantly higher energy efficiency and reduced latency. The essential idea is to map the synaptic weights corresponding to each layer to one or more computational memory (CM) cores. During inference, these cores perform the associated matrix-vector multiply operations in place with O(1) time complexity, thus obviating the need to move the synaptic weights to an additional processing unit. Moreover, this architecture could enable the execution of these networks in a highly pipelined fashion. However, a key challenge is to design an efficient communication fabric for the CM cores. Here, we present one such communication fabric based on a graph topology that is well suited for the widely successful convolutional neural networks (CNNs). We show that this communication fabric facilitates the pipelined execution of all state of-the-art CNNs by proving the existence of a homomorphism between one graph representation of these networks and the proposed graph topology. We then present a quantitative comparison with established communication topologies and show that our proposed topology achieves the lowest bandwidth requirements per communication channel. Finally, we present a concrete example of mapping ResNet-32 onto an array of CM cores.

연구 동기 및 목표

  • 계산 메모리(CM) 코어 간 비효율적인 통신으로 인해 발생하는 파이프라인 기반 CNN 추론의 성능 저하 문제를 해결하기 위해.
  • 다양한 최신 CNN 아키텍처를 추가적인 연결 없이도 지원할 수 있는 통신 패브릭 토폴로지 아키텍처를 설계하기 위해.
  • 계산 메모리 기반 DNN 가속기에서 통신 채널당 지연과 대역폭 요구량을 최소화하기 위해.
  • 모든 주요 CNN 아키텍처(순방향 전파, 잔차 연결, Inception, 밀도 연결)가 제안된 5PP 토폴로지에 매핑 가능한 것을 이론적으로 증명하기 위해.

제안 방법

  • 계산 메모리 어레인지에서 물리적 근접성과 파이프라인 실행에 최적화된 새로운 그래프 기반 통신 토폴로지인 5 Parallel Prism(5PP)을 제안한다.
  • 층을 정점으로, 활성화 흐름을 간선으로 표현하는 CNN의 통합된 그래프 표현을 정의하여 네트워크 실행 가능성에 대한 공식적 분석을 가능하게 한다.
  • 파이프라인 실행을 위한 수학적 조건을 설정: CNN의 그래프 표현에서 5PP 토폴로지로의 그래프 호모모르피즘 존재 여부.
  • 호모모르피즘 존재 여부를 이론적 기준으로 삼아, ResNet, Inception, DenseNet이 5PP에 매핑 가능한 것을 증명한다.
  • 지연, 처리량, 채널당 대역폭 등의 지표를 사용하여 5PP와 2D 메시 토폴로지 간의 정량적 비교를 수행한다.
  • 4×10 CM 코어 어레이에 대한 ResNet-32의 상세 물리적 매핑을 제공하며, 데이터 플로우, 메모리 사용량, 대역폭 요구량을 명시한다.

실험 결과

연구 질문

  • RQ1계산 메모리 어레인지에서 모든 주요 CNN 아키텍처의 파이프라인 기반 추론을 가능하게 하는 통신 토폴로지를 설계할 수 있는가?
  • RQ2다양한 CNN의 저지연, 고처리량 실행을 지원하기 위해 통신 패브릭이 가져야 할 필수적 및 충분한 토폴로지적 성질은 무엇인가?
  • RQ35PP 토폴로지가 2D 메시와 같은 기존 토폴로지와 비교해 지연과 대역폭 효율성 측면에서 어떻게 성능을 냈는가?
  • RQ4주어진 통신 패브릭에서 파이프라인 스토우 없이 실행 가능한지 판단할 수 있는 공식적 기준이 존재하는가?
  • RQ55PP 토폴로지를 사용하여 CM 어레이에 ResNet-32를 매핑할 경우 실용적인 메모리 및 대역폭 요구량은 얼마인가?

주요 결과

  • 5PP 토폴로지는 CNN의 그래프 표현과 5PP 토폴로지 사이의 호모모르피즘 존재를 증명함으로써, ResNet, Inception, DenseNet을 포함한 모든 최신 CNN 아키텍처의 파이프라인 실행을 가능하게 한다.
  • 2D 메시의 최고 성능 구성 대비 5PP 토폴로지는 추론 지연을 최대 7배 감소시키고, 채널당 대역폭 요구량을 최대 4배 감소시킨다.
  • 5PP의 상호 연결 수는 2D 메시 대비 2.31배 증가하지만, 이는 지연 7배 향상과 대역폭 효율성 4배 향상에 비해 훨씬 낮은 증가 비율이다.
  • 4×10 CM 코어 어레이에 대한 ResNet-32 매핑에서 제안된 토폴로지는 파이프라인 스토우 없이 작동하며, 채널당 필요 대역폭은 약 5 Gbps로, 최신 차세대 내장 링크 성능 범위 내에 있다.
  • CM 코어에 대한 ResNet-32의 물리적 매핑은 순방향 전파 경로와 잔차 경로의 활성화를 별도의 채널로 전송함으로써 최소한의 오버헤드로 효율적인 데이터 플로우를 구현할 수 있음을 보여준다.
  • 그래프 호모모르피즘 기반 이론적 프레임워크는 주어진 통신 패브릭에 어떤 CNN 아키텍처도 매핑 가능한지를 확인하는 일반적인 방법을 제공하며, 향후 가속기의 체계적 설계를 가능하게 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.