[논문 리뷰] GraphR: Accelerating Graph Processing Using ReRAM
GraphR는 희소 행렬-벡터 곱셈(SpMV)을 가속화하기 위해 ReRAM 크로스바를 통한 아날로그 내장 계산을 활용하는 최초의 ReRAM 기반 그래프 처리 가속기이다. 이는 CPU 대비 최대 132.67배의 성능 향상과 33.82배의 에너지 절감을 달성하며, 내장 계산과 비揮성 메모리 특성을 활용해 GPU 및 PIM 기반 시스템을 뛰어넘는 성능과 에너지 효율성을 확보한다.
This paper presents GRAPHR, the first ReRAM-based graph processing accelerator. GRAPHR follows the principle of near-data processing and explores the opportunity of performing massive parallel analog operations with low hardware and energy cost. The analog computation is suit- able for graph processing because: 1) The algorithms are iterative and could inherently tolerate the imprecision; 2) Both probability calculation (e.g., PageRank and Collaborative Filtering) and typical graph algorithms involving integers (e.g., BFS/SSSP) are resilient to errors. The key insight of GRAPHR is that if a vertex program of a graph algorithm can be expressed in sparse matrix vector multiplication (SpMV), it can be efficiently performed by ReRAM crossbar. We show that this assumption is generally true for a large set of graph algorithms. GRAPHR is a novel accelerator architecture consisting of two components: memory ReRAM and graph engine (GE). The core graph computations are performed in sparse matrix format in GEs (ReRAM crossbars). The vector/matrix-based graph computation is not new, but ReRAM offers the unique opportunity to realize the massive parallelism with unprecedented energy efficiency and low hardware cost. With small subgraphs processed by GEs, the gain of performing parallel operations overshadows the wastes due to sparsity. The experiment results show that GRAPHR achieves a 16.01x (up to 132.67x) speedup and a 33.82x energy saving on geometric mean compared to a CPU baseline system. Com- pared to GPU, GRAPHR achieves 1.69x to 2.19x speedup and consumes 4.77x to 8.91x less energy. GRAPHR gains a speedup of 1.16x to 4.12x, and is 3.67x to 10.96x more energy efficiency compared to PIM-based architecture.
연구 동기 및 목표
- 기존 그래프 처리 아키텍처에서 발생하는 높은 메모리 대역폭과 데이터 이동 오버헤드 문제를 해결하기 위해.
- 반복적 그래프 알고리즘의 내재된 오류 내성 특성을 활용해 신뢰성 있는 비휘성 메모리에서 아날로그 계산을 가능하게 하기 위해.
- ReRAM 크로스바와 그래프 엔진을 통합해 효율적인 내장 SpMV 실행을 위한 새로운 가속기 설계를 위해.
- CPU, GPU 및 PIM 기반 시스템 대비 뚜렷한 성능 및 에너지 효율성 향상을 입증하기 위해.
- 실세계 그래프 워크로드에 대해 ReRAM 기반 아날로그 계산이 실현 가능하고 효율적인지 검증하기 위해.
제안 방법
- GraphR는 그래프 알고리즘의 핵심 연산인 희소 행렬-벡터 곱셈(SpMV)을 ReRAM 크로스바에 매핑하여 내장 아날로그 계산을 수행한다.
- 두 구성 요소로 이루어진 아키텍처를 사용한다: 희소 행렬을 저장하기 위한 ReRAM 기반 메모리와 병렬 아날로그 연산을 수행하는 그래프 엔진(GEs).
- 작은 서브그래프를 병렬로 처리하며, 거대한 병렬성의 이점이 희소성으로 인한 비효율성보다 뛰어나다.
- 아날로그 계산은 직접 ReRAM 크로스바에서 수행되어 데이터를 처리 유닛으로 이동시키지 않고도 에너지 효율적인 행렬-벡터 곱셈을 가능하게 한다.
- ReRAM의 비휘성 특성을 활용해 정적 에너지 누설을 최소화하고, 데이터 이동을 줄이기 위해 내장 처리를 지원한다.
- GraphR는 하이브리드 실행 모델을 채택하여, 다량의 병렬성을 가지는 SpMV 연산은 ReRAM 크로스바로 이관하고, 비정규적인 메모리 액세스는 주 메모리에서 처리한다.
실험 결과
연구 질문
- RQ1ReRAM 크로스바를 활용한 아날로그 내장 계산이 그래프 처리 워크로드를 효과적으로 가속화할 수 있는가?
- RQ2반복적 그래프 알고리즘의 내재된 오류 내성 특성이 아날로그 ReRAM 연산의 정밀도 부족을 어느 정도 견딜 수 있는가?
- RQ3CPU, GPU 및 PIM 기반 가속기 대비 ReRAM 기반 SpMV의 성능과 에너지 효율성은 어떻게 비교되는가?
- RQ4데이터의 희소성이 GraphR의 성능과 에너지 효율성에 미치는 영향은 어떠한가?
- RQ5내장 계산과 희소 행렬 표현을 조합한 GraphR의 아키텍처 설계가 뛰어난 속도 향상과 에너지 절감을 달성할 수 있는가?
주요 결과
- 모든 평가 대상 그래프 워크로드에서 GraphR는 CPU 기반 시스템 대비 기하평균 16.01배(최대 132.67배)의 성능 향상을 달성했다.
- CPU 플랫폼 대비 기하평균 33.82배의 에너지 절감을 제공했으며, SD 데이터셋을 사용한 희소 행렬-벡터 곱셈에서 최고 217.88배의 에너지 절감을 기록했다.
- GPU 대비 GraphR는 성능은 1.69배에서 2.19배 높고, 에너지 소비는 4.77배에서 8.91배 적게 소모했으며, 계산 유닛 수는 유사한 수준이었다.
- PIM 기반 아키텍처 대비 GraphR는 속도 향상에서 1.16배에서 4.12배 높고, 에너지 효율성은 3.67배에서 10.96배 높았다.
- 희소성이 증가함에 따라 성능과 에너지 효율성이 약간 감소하지만, 병렬성의 이점이 여전히 오버헤드를 압도한다.
- 결과는 ReRAM 기반 아날로그 계산이 그래프 처리에 실현 가능하고 효과적이며, PageRank 및 협업 필터링과 같이 MAC 연산이 지배적인 알고리즘에 특히 유리하다는 것을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.