Skip to main content
QUICK REVIEW

[논문 리뷰] EMOGI: Efficient Memory-access for Out-of-memory Graph-traversal In GPUs

Seung Won Min, Vikram Sharma Mailthody|arXiv (Cornell University)|2020. 06. 12.
Graph Theory and Algorithms참고 문헌 56인용 수 10
한 줄 요약

EMOGI는 GPU 기반 그래프 탐색을 위한 캐시 라인 크기의 메모리 접근 메커니즘을 제안하며, 외부 메모리 요청을 코ales싱하고 정렬하여 UVM의 페이지 장애 오버헤드를 피한다. 이는 PCIe 대역폭 활용도를 극대화하고 I/O 과잉 증폭을 최소화함으로써 최적화된 UVM 구현 대비 평균 2.60×의 성능 향상을 달성한다.

ABSTRACT

Modern analytics and recommendation systems are increasingly based on graph data that capture the relations between entities being analyzed. Practical graphs come in huge sizes, offer massive parallelism, and are stored in sparse-matrix formats such as CSR. To exploit the massive parallelism, developers are increasingly interested in using GPUs for graph traversal. However, due to their sizes, graphs often do not fit into the GPU memory. Prior works have either used input data pre-processing/partitioning or UVM to migrate chunks of data from the host memory to the GPU memory. However, the large, multi-dimensional, and sparse nature of graph data presents a major challenge to these schemes and results in significant amplification of data movement and reduced effective data throughput. In this work, we propose EMOGI, an alternative approach to traverse graphs that do not fit in GPU memory using direct cacheline-sized access to data stored in host memory. This paper addresses the open question of whether a sufficiently large number of overlapping cacheline-sized accesses can be sustained to 1) tolerate the long latency to host memory, 2) fully utilize the available bandwidth, and 3) achieve favorable execution performance. We analyze the data access patterns of several graph traversal applications in GPU over PCIe using an FPGA to understand the cause of poor external bandwidth utilization. By carefully coalescing and aligning external memory requests, we show that we can minimize the number of PCIe transactions and nearly fully utilize the PCIe bandwidth even with direct cache-line accesses to the host memory. EMOGI achieves 2.92$ imes$ speedup on average compared to the optimized UVM implementations in various graph traversal applications. We also show that EMOGI scales better than a UVM-based solution when the system uses higher bandwidth interconnects such as PCIe 4.0.

연구 동기 및 목표

  • 그래프가 GPU 메모리 용량을 초과할 경우 GPU 기반 그래프 탐색에서 발생하는 성능 저하 문제를 해결한다.
  • 비정규적이고 희소한 그래프 워크로드에서 UVM가 I/O 읽기 과잉 증폭과 낮은 대역폭 활용도로 인해 성능이 열등한 이유를 조사한다.
  • 호스트 메모리에 대한 세밀한 캐시 라인 크기의 메모리 접근이 장시간 지연에 견딜 수 있는 고대역폭을 유지할 수 있는지 탐색한다.
  • UVM이나 사전 처리에 의존하지 않고 PCIe 트랜잭션 수를 최소화하고 효과적 메모리 대역폭을 극대화하는 시스템을 설계한다.
  • 직접 메모리 접근이 UVM 기반 접근 방식을 능가하고, PCIe 4.0와 같은 고대역폭 인터커넥트에서 더 나은 확장성을 보일 수 있음을 입증한다.

제안 방법

  • FPGA를 사용하여 PCIe를 통해 GPU 메모리 접근 패턴을 분석함으로써 UVM 기반 그래프 탐색의 비효율성을 규명한다.
  • UVM의 페이지 수준 이동에 의존하지 않고, 호스트 메모리에 직접 캐시 라인 크기의 접근을 구현한다.
  • PCIe 트랜잭션 수를 줄이고 데이터 전송 효율을 향상시키기 위해 메모리 요청을 코ales싱하고 정렬한다.
  • 지연을 최소화하고 가용 PCIe 대역폭을 극대화하기 위해 메모리 접근 패턴을 최적화한다.
  • 명시적 메모리 관리나 그래프 사전 처리 없이도 핵심 그래프 탐색 커널(예: BFS, SSSP)에 최적화된 접근 패턴을 통합한다.
  • 다양한 그래프 워크로드와 인터커넥트에서 최적화된 UVM 및 이전 최고 수준의 접근 방식과의 성능을 평가한다.

실험 결과

연구 질문

  • RQ1호스트 메모리에 대한 직접 캐시 라인 크기의 접근이 GPU 그래프 탐색에서 장시간 지연에 견딜 수 있는 고대역폭을 유지할 수 있는가?
  • RQ2비정규적이고 희소한 그래프 워크로드에서 UVM가 투명한 메모리 관리를 제공함에도 불구하고 외부 메모리 대역폭 활용도가 열악한 이유는 무엇인가?
  • RQ3메모리 요청을 코ales싱하고 정렬함으로써 PCIe 트랜잭션 수를 얼마나 줄일 수 있고, 효과적 대역폭을 얼마나 향상시킬 수 있는가?
  • RQ4PCIe 4.0와 같은 향상된 인터커넥트 대역폭에서 EMOGI의 성능은 UVM 기반 솔루션 대비 어떻게 확장되는가?
  • RQ5사전 처리, 재정렬, 하드웨어 수정 없이도 EMOGI가 UVM 기반 시스템을 능가할 수 있는가?

주요 결과

  • EMOGI는 다양한 그래프 탐색 워크로드에서 최적화된 UVM 구현 대비 평균 2.60×의 성능 향상을 달성한다.
  • 성능 향상의 근본 원인은 전체 4KB 페이지를 가져오는 대신 필요한 바이트만 세밀한 접근으로 가져옴으로써 I/O 읽기 과잉 증폭을 제거한 데 있다.
  • 요청 코ales싱과 정렬을 통해 트랜잭션 수를 최소화함으로써 EMOGI는 거의 완전히 PCIe 대역폭을 활용한다.
  • 페이지 장애 처리 오버헤드에 대한 의존도가 감소함에 따라 EMOGI는 PCIe 4.0와 같은 향상된 인터커넥트 대역폭에서 거의 선형적인 확장성을 보인다.
  • 이 방법은 기존 UVM 최적화 기법과 수직적(orthogonal)이며, 예측 기능, 메모리 힌트, 그래프 재정렬과 같은 기법과 결합하여 추가적인 성능 향상을 얻을 수 있다.
  • 이 방법은 응용 프로그램 수준의 변경 없이도 라이브러리 형태로 구현되어 투명한 성능 향상을 제공할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.