Skip to main content
QUICK REVIEW

[논문 리뷰] Rubik: A Hierarchical Architecture for Efficient Graph Learning

Xiaobing Chen, Yuke Wang|arXiv (Cornell University)|2020. 09. 26.
Advanced Graph Neural Networks참고 문헌 48인용 수 9
한 줄 요약

Rubik은 그래프 신경망(GNNs)에서 그래프 수준과 노드 수준의 계산을 분리하는 계층적 가속기 아키텍처를 제안한다. 이는 경량 그래프 재정렬과 맞춤형 캐시 설계를 통해 효율적인 하드웨어 가속을 가능하게 한다. 다양한 GCN 모델과 데이터셋에서 GPU 대비 에너지 효율성이 26.3배에서 1375.2배 높다.

ABSTRACT

Graph convolutional network (GCN) emerges as a promising direction to learn the inductive representation in graph data commonly used in widespread applications, such as E-commerce, social networks, and knowledge graphs. However, learning from graphs is non-trivial because of its mixed computation model involving both graph analytics and neural network computing. To this end, we decompose the GCN learning into two hierarchical paradigms: graph-level and node-level computing. Such a hierarchical paradigm facilitates the software and hardware accelerations for GCN learning. We propose a lightweight graph reordering methodology, incorporated with a GCN accelerator architecture that equips a customized cache design to fully utilize the graph-level data reuse. We also propose a mapping methodology aware of data reuse and task-level parallelism to handle various graphs inputs effectively. Results show that Rubik accelerator design improves energy efficiency by 26.3x to 1375.2x than GPU platforms across different datasets and GCN models.

연구 동기 및 목표

  • 불규칙한 그래프 분석과 규칙적인 신경망 계산을 병합하는 그래프 컬러션 네트워크(GCNs)를 효율적으로 가속화하는 도전 과제 해결
  • 기존 가속기(일반 목적 DNN 가속기 및 그래프 전용 가속기)의 한계를 극복하여 GCN의 하이브리드 데이터 플로우와 워크로드 다양성을 처리할 수 있도록 함
  • GCN 계산을 계층적 그래프 수준 및 노드 수준의 패러다임으로 분리하여 소프트웨어 및 하드웨어 최적화를 타겟팅 가능하게 함
  • 고도로 불규칙한 그래프 액세스와 높은 데이터 재사용을 위한 경량 그래프 재정렬 기법을 도입하여 GCN 학습 시 메모리 액세스 오버헤드를 감소시키고 데이터 재사용을 향상시킴
  • 데이터 재사용과 작업 수준 병렬성에 대한 인지 기반 매핑 방법론을 개발하여 다양한 그래프 입력 및 모델 아키텍처에 맞춰 하드웨어 자원을 유연하게 활용함

제안 방법

  • GCN 추론 및 학습을 두 가지 별도의 계층적 계산 단계로 분해: 그래프 수준(집합 과정에서 비유럽형 데이터 액세스를 위한 불규칙한 액세스)과 노드 수준(업데이트 과정에서 규칙적인 밀도 높은 텐서 연산을 위한 정규 연산)
  • 고도로 연결된 노드와 조밀한 부분그래프에 특화된 데이터 재사용을 극대화하기 위해 노드 순서를 재정렬하는 경량 그래프 재정렬 전략 제안
  • GCN 워크로드에서 불규칙한 그래프 데이터 액세스와 규칙적인 텐서 데이터 재사용을 모두 지원하는 전용 캐시 아키텍처를 포함한 맞춤형 메모리 계층 설계
  • 기능 차원과 그래프 구조에 따라 워크로드 특성에 따라 동적으로 적응하는 프로그래밍 모델 및 작업 매핑 전략 통합으로 계산과 메모리 액세스 간 균형을 조정
  • 노드 수준 계산에서 효율적인 MAC 연산을 지원하면서도 불규칙한 그래프 탐색을 유지할 수 있도록 최적화된 데이터 플로우(예: 입력 정적 또는 가중치 정적)를 갖춘 공간 아키텍처 구현
  • 재정렬에 기반한 배치 및 샘플링 전략을 통합하여 학습 중 수렴 속도와 메모리 효율성을 향상

실험 결과

연구 질문

  • RQ1통합 하드웨어 가속기가 GCN의 그래프 분석과 딥 뉴럴 네트워크 계산의 혼합 워크로드를 어떻게 효율적으로 처리할 수 있는가?
  • RQ2경량 그래프 재정렬이 GCN 학습에서 데이터 재사용을 얼마나 향상시키고 메모리 액세스 오버헤드를 얼마나 감소시킬 수 있는가?
  • RQ3그래프 수준과 노드 수준 연산을 분리하는 계층적 계산 모델이 더 나은 하드웨어 특화 및 성능 확장성을 가능하게 하는가?
  • RQ4다양한 GCN 모델과 데이터셋에서 제안된 가속기가 기존 DNN 및 그래프 가속기 대비 에너지 효율성과 성능에서 어떻게 비교되는가?
  • RQ5워크로드 인식 기반의 작업 매핑이 이질적인 GCN 워크로드에서 하드웨어 활용도와 가속 효율성에 어떤 영향을 미치는가?

주요 결과

  • Rubik은 다양한 GCN 모델과 데이터셋에서 GPU 플랫폼 대비 26.3배에서 1375.2배 높은 에너지 효율성을 달성하여 뚜렷한 성능 및 효율성 향상을 입증함
  • 제안된 경량 그래프 재정렬 기법이 그래프 수준 계산에서 시간적 데이터 재사용을 향상시켜 메모리 액세스 오버헤드를 감소시키고 캐시 활용도를 향상시킴
  • 계층적 아키텍처는 효과적인 하드웨어 특화를 가능하게 하며, 전용 캐시 설계로 그래프 수준의 데이터 재사용을 최적화하고, 공간 가속기로 노드 수준의 고밀도 연산을 효율적으로 처리함
  • 매핑 방법론은 워크로드 다양성에 효과적으로 대응하여 기능 차원과 그래프 구조가 다른 그래프 간에 계산과 메모리 액세스를 균형 있게 조정함
  • 재정렬된 그래프 구조는 배치 및 샘플링 전략의 효과를 향상시켜 GCN 학습 중 수렴 속도를 개선함
  • 기존 일반 목적 DNN 가속기와 기존 그래프 가속기 모두를 초월하며, 아키텍처적 및 알고리즘적 공동 설계를 통해 GCN의 고유한 하이브리드 데이터 플로우 문제를 해결함

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.