Skip to main content
QUICK REVIEW

[논문 리뷰] FIGARO: Improving System Performance via Fine-Grained In-DRAM Data Relocation and Caching

Yaohua Wang, Lois Orosa|arXiv (Cornell University)|2020. 09. 17.
Parallel Computing and Optimization Techniques참고 문헌 152인용 수 7
한 줄 요약

FIGARO는 공유 글로벌 버퍼를 활용해 DRAM 뱅크 내에서 거리에 관계없이 세밀한 수준의 데이터 이동을 가능하게 하는 저비용 DRAM 서브스트레이트를 제안한다. 이를 통해 FIGCache—세밀한 수준의 내부 DRAM 캐시—는 빈번히 액세스되는 데이터 블록만 캐시할 수 있으며, 이는 기존 DDR4 시스템 대비 8코어 워크로드에서 DRAM 지연 시간과 에너지 소비를 각각 16.3%와 7.8% 감소시킨다.

ABSTRACT

DRAM Main memory is a performance bottleneck for many applications due to the high access latency. In-DRAM caches work to mitigate this latency by augmenting regular-latency DRAM with small-but-fast regions of DRAM that serve as a cache for the data held in the regular-latency region of DRAM. While an effective in-DRAM cache can allow a large fraction of memory requests to be served from a fast DRAM region, the latency savings are often hindered by inefficient mechanisms for relocating copies of data into and out of the fast regions. Existing in-DRAM caches have two sources of inefficiency: (1) the data relocation granularity is an entire multi-kilobyte row of DRAM; and (2) because the relocation latency increases with the physical distance between the slow and fast regions, multiple fast regions are physically interleaved among slow regions to reduce the relocation latency, resulting in increased hardware area and manufacturing complexity. We propose a new substrate, FIGARO, that uses existing shared global buffers among subarrays within a DRAM bank to provide support for in-DRAM data relocation across subarrays at the granularity of a single cache block. FIGARO has a distance-independent latency within a DRAM bank, and avoids complex modifications to DRAM. Using FIGARO, we design a fine-grained in-DRAM cache called FIGCache. The key idea of FIGCache is to cache only small, frequently-accessed portions of different DRAM rows in a designated region of DRAM. By caching only the parts of each row that are expected to be accessed in the near future, we can pack more of the frequently-accessed data into FIGCache, and can benefit from additional row hits in DRAM. Our evaluations show that FIGCache improves the average performance of a system using DDR4 DRAM by 16.3% and reduces average DRAM energy consumption by 7.8% for 8-core workloads, over a conventional system without in-DRAM caching.

연구 동기 및 목표

  • 현대 시스템에서 높은 DRAM 액세스 지연 시간으로 인한 성능 저하 문제를 해결한다.
  • 거시적 수준의 행 기반 데이터 이동을 사용하는 기존 내부 DRAM 캐시의 비효율성을 극복한다.
  • 빠른 및 느린 서브어레이의 복잡한 인터리빙이 필요 없도록 하여 하드웨어 복잡성과 면적 오버헤드를 줄인다.
  • 기존 주변 회로를 활용해 DRAM 뱅크 내에서 효율적이고 저지연의 데이터 마이그레이션을 가능하게 한다.
  • 다양한 워크로드에서 성능과 에너지 효율성을 향상시키는 실용적이고 확장 가능한 내부 DRAM 캐시(FIGCache)를 설계한다.

제안 방법

  • DRAM 서브어레이 내 공유 글로벌 레지스터 버퍼를 활용해, 일반적으로 64B인 단일 캐시 블록 수준의 뱅크 내 데이터 이동을 가능하게 한다.
  • 글로벌 레지스터 버퍼 네트워크를 통해 빠른 및 느린 서브어레이의 물리적 인터리빙 없이도 DRAM 뱅크 내 서브어레이 간 데이터를 이동시킨다.
  • 다중 행에 걸쳐 빈번히 액세스되는 데이터 세그먼트만 캐시하는 세밀한 수준의 내부 DRAM 캐시(FIGCache)를 구현한다.
  • 글로벌 버퍼 인프라를 통해 원본과 대상 서브어레이 간 물리적 거리와 관계없이 이동 지연 시간을 최소화한다.
  • 기존 메모리 컨트롤러와 통합하고, 동일한 행에 자주 액세스되는 데이터 블록을 공유 위치에 배치함으로써 레지스터 버퍼 히트 활용을 지원한다.
  • 전용 빠른 서브어레이가 없는 상황에서도 캐싱이 가능하도록 하여 기존 동종 DRAM 뱅크와의 후행 호환성을 확보한다.

실험 결과

연구 질문

  • RQ1DRAM 뱅크 내에서 세밀한 수준의 데이터 이동이 하드웨어 복잡성 증가 없이 내부 DRAM 캐시 지연 시간을 줄이고 성능을 향상시킬 수 있는가?
  • RQ2공유 글로벌 버퍼를 활용한 거리에 관계없는 데이터 이동이 행 기반 이동 대비 내부 DRAM 캐싱의 효율성에 어떤 영향을 미치는가?
  • RQ3FIGCache는 이질적 및 동종 DRAM 아키텍처 모두에서 시스템 성능과 에너지 효율성을 어느 정도 향상시킬 수 있는가?
  • RQ4다양한 워크로드와 시스템 파라미터에서 FIGCache는 최신 내부 DRAM 캐싱 기법과 비교해 어떤가?
  • RQ5FIGARO 서브스트레이트는 상용 DRAM 설계와 호환되는 실용적이고 저비용의 내부 DRAM 캐싱을 가능하게 하는가?

주요 결과

  • 8코어 워크로드에서 기존 DDR4 시스템 대비 내부 DRAM 캐싱이 없는 경우 FIGCache는 평균 시스템 성능을 16.3% 향상시킨다.
  • 동일한 8코어 워크로드에서 FIGCache는 평균 DRAM 에너지 소비를 7.8% 감소시킨다.
  • FIGCache의 성능 향상 효과는 다양한 시스템 파라미터, 즉 다양한 메모리 액세스 패턴과 워크로드에서 뛰어난 안정성을 보인다.
  • 세밀한 수준의 이동과 물리적 서브어레이 인터리빙을 피함으로써 FIGCache는 최신 내부 DRAM 캐싱 기법을 초월하는 성능을 달성한다.
  • FIGARO 서브스트레이트는 DRAM 뱅크 내에서 거리에 관계없는 이동 지연 시간을 가능하게 하여 서브어레이 간 긴 물리적 거리로 인한 성능 저하를 제거한다.
  • FIGCache는 전용 빠른 서브어레이가 없는 기존 동종 DRAM 뱅크에서도 상당한 이점을 제공함을 입증하며, 효과적인 내부 DRAM 캐싱을 위해 전용 빠른 서브어레이가 반드시 필요한 것은 아님을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.