Skip to main content
QUICK REVIEW

[논문 리뷰] Benchmarking a New Paradigm: An Experimental Analysis of a Real Processing-in-Memory Architecture

Juan Gómez-Luna, Izzat El Hajj|arXiv (Cornell University)|2021. 05. 09.
Parallel Computing and Optimization Techniques참고 문헌 234인용 수 50
한 줄 요약

본 논문은 실제 세계의 UPMEM PIM 아키텍처에 대한 최초의 포괄적인 실험적 특성화와 PrIM 벤치마크 스위트를 도입하여 PIM의 성능과 에너지를 CPU 및 GPU 기준선과 비교합니다.

ABSTRACT

Many modern workloads, such as neural networks, databases, and graph processing, are fundamentally memory-bound. For such workloads, the data movement between main memory and CPU cores imposes a significant overhead in terms of both latency and energy. A major reason is that this communication happens through a narrow bus with high latency and limited bandwidth, and the low data reuse in memory-bound workloads is insufficient to amortize the cost of main memory access. Fundamentally addressing this data movement bottleneck requires a paradigm where the memory system assumes an active role in computing by integrating processing capabilities. This paradigm is known as processing-in-memory (PIM). Recent research explores different forms of PIM architectures, motivated by the emergence of new 3D-stacked memory technologies that integrate memory with a logic layer where processing elements can be easily placed. Past works evaluate these architectures in simulation or, at best, with simplified hardware prototypes. In contrast, the UPMEM company has designed and manufactured the first publicly-available real-world PIM architecture. This paper provides the first comprehensive analysis of the first publicly-available real-world PIM architecture. We make two key contributions. First, we conduct an experimental characterization of the UPMEM-based PIM system using microbenchmarks to assess various architecture limits such as compute throughput and memory bandwidth, yielding new insights. Second, we present PrIM, a benchmark suite of 16 workloads from different application domains (e.g., linear algebra, databases, graph processing, neural networks, bioinformatics).

연구 동기 및 목표

  • 네트워크?
  • 데이터 이동 병목 현상을 해결하기 위해 메모리 바운드 워크로드(예: 신경망, 데이터베이스, 그래프 처리)에서 데이터 이동 병목 문제를 해결하기 위해 PIM 패러다임을 고무한다.
  • 마이크로벤치마크와 새로운 벤치마크 스위트를 통해 최초의 공개적으로 이용 가능한 실제 PIM 시스템(UPMEM)을 특성화한다.
  • 향후 PIM 아키텍처와 소프트웨어 스택을 개선하기 위한 실행 가능한 프로그래밍 및 하드웨어 설계 통찰을 제공한다.

제안 방법

  • 정수 연산 및 데이터 타입 전반에 걸친 DPU 컴퓨트 처리량을 측정하기 위한 마이크로벤치마크를 개발한다.
  • 다양한 접근 패턴에서 두 메모리 공간(MRAM과 WRAM)에 대한 지속 대역폭을 측정한다.
  • 호스트-CPU와 DPU 간 상호 작용 및 호스트를 통한 상호-DPU 데이터 전송을 위한 MRAM 간 지속 대역폭을 평가한다.
  • 여러 도메인(선형대수, 데이터베이스, 그래프 처리, 신경망, 생정보학, 이미지 처리)에 걸친 16개의 메모리 바운드 워크로드로 구성된 PrIM 벤치마크 스위트를 만든다.
  • 실제 UPMEM 시스템 두 대(640개 DPU 및 2,556개 DPU)에서 PrIM의 성능과 에너지를 평가하고 이를 CPU 및 GPU 기준선과 비교한다.
  • 마이크로벤치마크와 PrIM을 커뮤니티 사용을 위해 공개적으로 제공한다.

실험 결과

연구 질문

  • RQ1어떤 워크로드와 데이터 패턴이 UPMEM PIM 아키텍처에 가장 적합한가?
  • RQ2실세계 PIM 하드웨어의 주요 병목 현상과 성능 한계는 무엇인가(계산 중심 대 메모리 바운드 제약)?
  • RQ3호스트 CPU를 통한 DPU 간 통신이 스케일링과 에너지 효율성에 어떤 영향을 미치는가?
  • RQ4PrIM 워크로드가 CPU 및 GPU 대비 속도 향상 및 에너지 측면에서 어떻게 성능을 보이는가?
  • RQ5특성화 결과를 바탕으로 향후 PIM 시스템에 대한 프로그래밍 및 아키텍처 권고사항은 무엇인가?

주요 결과

  • UPMEM PIM 아키텍처는 기본적으로 컴퓨트 바운드이며, 복잡한 산술이 메모리 대역폭이 한계가 되기 전에 파이프라인을 포화시킬 수 있다.
  • DPU 간 직접 채널이 없어 DPU 간 통신은 스케일링이 좋지 않으며 모든 동기화는 메모리 버스를 통해 호스트를 거친다.
  • PrIM 워크로드는 16개 벤치마크 중 13개에서 상호 DPU 동기화나 부동소수점 작업이 많지 않은 상태에서 현대 CPU를 평균보다 능가한다.
  • 2,556-DPU PIM 시스템은 스트리밍 메모리 접근 및 경미한 DPU 간 동기화 조건에서 벤치마크 10개에서 GPU를 평균보다 더 능가하며 2.54배 속도향상이다; 640-DPU 시스템은 격차가 더 작지만 일부 워크로드에서 여전히 GPU를 추월한다.
  • 에너지 소비 추세는 성능과 일치하며, 많은 워크로드에서 PIM이 CPU 및 GPU에 비해 큰 에너지 절감을 제공한다.
  • CPU/GPU와 비교할 때 PIM은 메모리 바운드 워크로드에 상당한 이점을 보이며, 저자들은 향후 PIM 시스템의 소프트웨어 및 하드웨어 설계를 안내하기 위한 권고사항을 제시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.