Skip to main content
QUICK REVIEW

[논문 리뷰] Moving Processing to Data: On the Influence of Processing in Memory on Data Management

Tobias Vinçon, Andreas Koch|arXiv (Cornell University)|2019. 05. 12.
Parallel Computing and Optimization Techniques참고 문헌 95인용 수 4
한 줄 요약

이 논문은 3D스택드 DRAM과 내장된 처리 유닛을 활용하여 메모리 저장소 내부 또는 근처에서 계산 작업을 직접 수행함으로써 데이터 이동을 줄이기 위한 프로세싱 인 메모리(PIM)를 패러다임으로 조사한다. PIM은 그래프 처리, 신경망, 분석 쿼리와 같은 데이터 집약적 워크로드에서 CPU 및 메모리 대역폭 병목 현상을 최소화함으로써 성능, 확장성, 에너지 효율성 향상에 크게 기여할 수 있음을 입증한다.

ABSTRACT

Near-Data Processing refers to an architectural hardware and software paradigm, based on the co-location of storage and compute units. Ideally, it will allow to execute application-defined data- or compute-intensive operations in-situ, i.e. within (or close to) the physical data storage. Thus, Near-Data Processing seeks to minimize expensive data movement, improving performance, scalability, and resource-efficiency. Processing-in-Memory is a sub-class of Near-Data processing that targets data processing directly within memory (DRAM) chips. The effective use of Near-Data Processing mandates new architectures, algorithms, interfaces, and development toolchains.

연구 동기 및 목표

  • 현대의 데이터 집약적 워크로드에서 스토리지, 메모리, CPU 간의 과도한 데이터 이동으로 인한 성능 저하 문제를 해결한다.
  • 프로세싱 인 메모리(PIM)가 데이터와 계산을 메모리에 근접시킴으로써 바르너먼 병목 현상을 완화할 수 있는 방법을 조사한다.
  • 비정규적인 액세스 패턴과 높은 데이터 볼륨을 특징으로 하는 데이터베이스 및 분석 워크로드에서 PIM의 확장성과 에너지 효율성 향상 잠재력을 평가한다.
  • 데이터 관리 시스템에서 PIM을 지원하기 위해 필요한 아키텍처적 및 알고리즘적 변화를 검토한다.
  • 그래프 처리, 신경망 학습, OLAP 워크로드와 같이 PIM이 성능 및 효율성 향상에 뚜렷한 이점을 제공하는 사용 사례를 특정하고 분석한다.

제안 방법

  • 기존의 데이터-코드 모델에서 코드-데이터 또는 인-사이트 처리 모델로의 전환을 제안하여 계산을 메모리 저장소 내부 또는 근처에서 수행한다.
  • 3D스택드 DRAM(HBM)과 스토리지 장치 내장된 처리 유닛(FPGA, CPU 등)을 활용하여 고대역폭, 저지연의 메모리 내 계산을 가능하게 한다.
  • 희소 행렬 및 그래프 처리를 위해 데이터 국소성과 희소성의 특성을 활용한 특수 설계된 PIM 하드웨어 가속기(LiM, TESSERACT)를 설계한다.
  • 메모리 내 데이터 레이아웃을 동적으로 재구성하여 캐시 효율성을 향상시키고 메모리 대역폭 낭비를 줄이기 위해 데이터 재배치 엔진(DRE)을 도입한다.
  • CPU 및 PIM 유닛 간의 효율적 작업 스케줄링을 가능하게 하기 위해 OpenCL과 같은 프로그래밍 모델을 확장하여 이종 PIM 시스템을 지원한다.
  • 실세계 워크로드인 PageRank, 일반화된 희소 행렬 곱셈, 딥러닝 학습을 시뮬레이션하고 평가하여 성능 및 에너지 향상 정도를 정량화한다.

실험 결과

연구 질문

  • RQ1프로세싱 인 메모리(PIM)가 데이터 집약적 워크로드에서 데이터 이동을 얼마나 줄이고 성능을 얼마나 향상시킬 수 있는가?
  • RQ2분석 및 머신러닝 워크로드에서 흔히 발생하는 비정규적인 액세스 패턴과 낮은 데이터 국소성에 대해 PIM 아키텍처는 어떻게 대응하는가?
  • RQ3현대의 데이터베이스 및 데이터 관리 시스템에 PIM을 통합할 때 발생하는 주요 아키텍처적 및 소프트웨어 인터페이스 과제는 무엇인가?
  • RQ4그래프 처리 및 신경망 학습에서 전통적인 CPU 기반 실행 대비 PIM 기반 가속기의 성능 및 에너지 효율성 향상이 뚜렷한가?
  • RQ5PIM 하드웨어를 효과적으로 활용하면서도 이식성과 유지보수성을 확보하기 위해 프로그래밍 모델과 추상화는 어떻게 확장되어야 하는가?

주요 결과

  • PIM 기반 시스템은 기존의 멀티스레드 CPU 구현 대비 희소 행렬-행렬 곱셈에서 성능 및 에너지 효율성 향상에 두 자릿수 이상의 개선을 보였다.
  • 데이터 재배치 엔진(DRE)은 메모리 내 데이터 레이아웃을 동적으로 재구성함으로써 그래프 처리 워크로드(예: PageRank)에서 캐시 효율성을 향상시키고 메모리 대역폭 낭비를 감소시켰다.
  • 그래프 처리를 위한 PIM 가속기인 TESSERACT는 사용자 지정 액세스 힌트와 효율적인 메모리 파artitioning을 통해 높은 메모리 대역폭 활용도를 달성하고 데이터 이동을 줄였다.
  • 3D스택드 메모리를 사용한 확장 가능한 신경망 가속기인 Tetris는 DRAM에 일부 계산을 오프로드함으로써 버스 경쟁을 줄이고 데이터 흐름을 개선하여 처리량을 향상시키고 에너지 소비를 감소시켰다.
  • PIM을 데이터 관리 시스템에 통합하기 위해서는 새로운 데이터베이스 연산자, 파이프라인 모델, 원자성 의미론이 필요하며, 이는 아직 개발이 부족하지만 강력한 잠재력을 보이고 있다.
  • 다양한 결과가 유망하나, 대부분의 기존 PIM 연구는 워크로드에 특화되어 있으며 일반적인 데이터베이스 연산에 대한 광범위한 지원이 부족하여, 데이터 관리 시스템 내에서 표준화된 PIM 프리미티브와 인터페이스의 필요성이 제기된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.