Skip to main content
QUICK REVIEW

[논문 리뷰] EnGN: A High-Throughput and Energy-Efficient Accelerator for Large Graph Neural Networks

Shengwen Liang, Ying Wang|arXiv (Cornell University)|2019. 08. 31.
Advanced Graph Neural Networks참고 문헌 41인용 수 9
한 줄 요약

EnGN은 새로운 린지-엣지-리덕션(RER) 데이터플로우와 재구성 가능한 PE-어레이 아키텍처를 도입함으로써 대규모 그래프 신경망(GNNs)의 고속도, 저에너지 효율성 추론을 가능하게 하는 전용 하드웨어 가속기이다. 이는 CPU 대비 최대 1802.9배의 속도 향상과 1326.35배 높은 에너지 효율성을 달성하였으며, 최신의 GCN 가속기인 HyGCN 대비 2.97배 빠른 속도와 6.2배 낮은 에너지 소비를 기록하였다.

ABSTRACT

Graph neural networks (GNNs) emerge as a powerful approach to process non-euclidean data structures and have been proved powerful in various application domains such as social networks and e-commerce. While such graph data maintained in real-world systems can be extremely large and sparse, thus employing GNNs to deal with them requires substantial computational and memory overhead, which induces considerable energy and resource cost on CPUs and GPUs. In this work, we present a specialized accelerator architecture, EnGN, to enable high-throughput and energy-efficient processing of large-scale GNNs. The proposed EnGN is designed to accelerate the three key stages of GNN propagation, which is abstracted as common computing patterns shared by typical GNNs. To support the key stages simultaneously, we propose the ring-edge-reduce(RER) dataflow that tames the poor locality of sparsely-and-randomly connected vertices, and the RER PE-array to practice RER dataflow. In addition, we utilize a graph tiling strategy to fit large graphs into EnGN and make good use of the hierarchical on-chip buffers through adaptive computation reordering and tile scheduling. Overall, EnGN achieves performance speedup by 1802.9X, 19.75X, and 2.97X and energy efficiency by 1326.35X, 304.43X, and 6.2X on average compared to CPU, GPU, and a state-of-the-art GCN accelerator HyGCN, respectively.

연구 동기 및 목표

  • CPU 및 GPU에서 대규모 희박한 실세계 그래프에 대한 GNN 실행 시 발생하는 높은 계산 및 메모리 오버헤드 문제를 해결하기 위해.
  • GNN의 비정규적이고 동적인 데이터 접근 패턴을 처리하는 데에 비효율적인 일반 목적 프로세서의 한계를 극복하기 위해.
  • GCN을 초과하는 다양한 GNN 아키텍처(예: GRN 및 GAT 포함)를 지원하는 전용 가속기 설계를 위해.
  • 변동하는 정점 특성 길이를 가진 힘의 법칙 분포 그래프에서의 데이터 국소성과 메모리 계층 최적화를 위해.
  • 모든 GNN 전파 단계에 대해 통합적이고 재구성 가능한 하드웨어 아키텍처를 통해 고처리량과 고에너지 효율성을 달성하기 위해.

제안 방법

  • 희박하고 랜덤하게 연결된 그래프에서의 열악한 데이터 국소성 문제를 해결하기 위해 정점 린지와 엣지 리덕션을 기반으로 한 새로운 린지-엣지-리덕션(RER) 데이터플로우를 제안한다.
  • GNN 레이어 간 동적 차원 변화를 지원하고 특성 추출, 집계, 업데이트 단계에서 고병렬성을 달성할 수 있는 재구성 가능한 RER PE-어레이 아키텍처를 설계한다.
  • 큰 그래프를 온칩 버퍼에 맞추고 버퍼 활용도를 극대화하기 위해 적응형 계산 재정렬과 타일 스케줄링을 포함한 그래프 타일링 전략을 도입한다.
  • 온칩 메모리 계층을 3단계(레지스터 파일, 공유 버퍼, 스크래치패드)로 구성하여 외부 메모리 접근을 줄이고 에너지 효율성을 향상시킨다.
  • GNN의 조밀한 텐서 연산을 효율적으로 처리하면서도 비정규적 그래프 접근에 대한 유연성을 유지하기 위해 RER PE-어레이 내에서 유사 시스톨릭 데이터플로우 패턴을 활용한다.
  • 모델 및 데이터셋 특성에 따라 PE-어레인지 크기(예: 32×32)를 조정하여 자원 활용도 저하를 방지하고 처리량을 극대화한다.

실험 결과

연구 질문

  • RQ1GCN을 초월하는 일반 GNN 모델의 다양한 비정규적 데이터플로우 패턴을 효율적으로 지원할 수 있는 하드웨어 가속기는 어떻게 설계할 수 있는가?
  • RQ2대규모 희박한, 힘의 법칙 분포를 가진 그래프에서 열악한 데이터 국소성을 효과적으로 완화할 수 있는 데이터플로우 및 메모리 접근 패턴은 무엇인가?
  • RQ3온칩 메모리 용량을 초월하는 그래프 처리를 가능하게 하기 위해 온칩 메모리 계층과 작업 스케줄링을 어떻게 공동 설계할 수 있는가?
  • RQ4도메인 특화 가속기의 성능 및 에너지 효율성 향상은 CPU, GPU 및 기존 GNN 가속기 대비 얼마나 되는가?
  • RQ5PE-어레인지 크기의 선택은 이질적인 GNN 워크로드에서 자원 활용도와 처리량에 어떤 영향을 미치는가?

주요 결과

  • EnGN은 다양한 GNN 모델과 데이터셋에서 CPU 대비 평균 1802.9배의 속도 향상과 1326.35배 높은 에너지 효율성을 달성하였다.
  • EnGN은 GPU 대비 평균 19.75배의 속도 향상과 304.43배 높은 에너지 효율성을 확보하였다.
  • 최신의 GCN 가속기인 HyGCN 대비 EnGN은 2.97배 높은 처리량과 6.2배 낮은 에너지 소비를 기록하였다.
  • 32×32 PE-어레인지에서는 입력 특성 차원(예: 16)이 열 수보다 작을 경우 성능 향상이 없었으며, 이는 동적 어레인지 크기 조정의 필요성을 시사한다.
  • 큰 데이터셋에서의 성능 향상은 작은 데이터셋에 비해 낮은 편이었는데, 이는 더 큰 PE 어레인지에서 집합 단계가 병목 현상이 되었고, 특히 엣지 대 정점 비율이 높을 경우 더욱 두드러졌다.
  • 그래프 타일링과 적응형 스케줄링은 버퍼 활용도를 크게 향상시키고 온칩 메모리 용량을 초월하는 그래프의 효율적 처리를 가능케 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.