[논문 리뷰] Exploiting the DRAM Microarchitecture to Increase Memory-Level Parallelism
이 논문은 DRAM 뱅크 내의 독립적인 서브어레이를 활용하고 요청의 순차화를 줄이기 위해 서브어레이 수준의 병렬 처리(SALP) 기법—SALP-1, SALP-2, 및 MASA—을 제안한다. 서브어레이 간의 활성화, 액세스, 프리차지 지연 시간을 겹쳐 처리함으로써, 최소한의 면적 오버헤드(<0.15%)로 메모리 수준의 병렬 처리를 향상시켜, 다양한 워크로드에서 멀티코어 시스템에서는 최대 20% 향상, 싱글코어 시스템에서는 17% 향상된 성능을 달성한다.
This paper summarizes the idea of Subarray-Level Parallelism (SALP) in DRAM, which was published in ISCA 2012, and examines the work's significance and future potential. Modern DRAMs have multiple banks to serve multiple memory requests in parallel. However, when two requests go to the same bank, they have to be served serially, exacerbating the high latency of on-chip memory. Adding more banks to the system to mitigate this problem incurs high system cost. Our goal in this work is to achieve the benefits of increasing the number of banks with a low-cost approach. To this end, we propose three new mechanisms, SALP-1, SALP-2, and MASA (Multitude of Activated Subarrays), to reduce the serialization of different requests that go to the same bank. The key observation exploited by our mechanisms is that a modern DRAM bank is implemented as a collection of subarrays that operate largely independently while sharing few global peripheral structures. Our three proposed mechanisms mitigate the negative impact of bank serialization by overlapping different components of the bank access latencies of multiple requests that go to different subarrays within the same bank. SALP-1 requires no changes to the existing DRAM structure, and needs to only reinterpret some of the existing DRAM timing parameters. SALP-2 and MASA require only modest changes (< 0.15% area overhead) to the DRAM peripheral structures, which are much less design constrained than the DRAM core. Our evaluations show that SALP-1, SALP-2 and MASA significantly improve performance for both single-core systems (7%/13%/17%) and multi-core systems (15%/16%/20%), averaged across a wide range of workloads. We also demonstrate that our mechanisms can be combined with application-aware memory request scheduling in multicore systems to further improve performance and fairness.
연구 동기 및 목표
- 동일한 DRAM 뱅크에 대한 여러 요청이 순차화되어 지연 시간이 증가하고 대역폭이 감소하는 문제로 인한 성능 저하를 해결한다.
- 은행 수를 늘리는 것만으로는 물리적 및 설계 제약으로 인해 높은 시스템 비용과 점점 감소하는 수익을 초래하므로, 이를 넘어서는 한계를 극복한다.
- 현대 DRAM 뱅크에 내재된 서브어레이 수준의 병렬성—각 서브어레이가 자체 로컬 레지스터 버퍼를 가짐—을 활용해, 동일한 뱅크 내 다른 서브어레이에 동시에 액세스할 수 있도록 한다.
- 여러 서브어레이를 동시에 활성화하고 액세스함으로써 메모리 수준의 병렬 처리와 레지스터 버퍼 국지성을 향상시키고, 쓰기 복구 오버헤드와 레지스터 버퍼 스래시링을 줄인다.
- 기존 DRAM 아키텍처에 큰 재설계 없이 통합할 수 있는 저오버헤드, 확장 가능한 기법을 개발하여 실용적인 구현을 가능하게 한다.
제안 방법
- 기존 DRAM 타이밍 파라미터를 재해석함으로써 하드웨어 변경 없이 서브어레이 수준의 병렬 처리를 가능하게 하는 SALP-1을 제안한다.
- 행 디코더 및 프리차지 논리와 같은 DRAM 주변 구조에 소량의 수정을 가해 서브어레이 액세스 지연 시간을 겹치게 하는 SALP-2를 도입한다.
- 한 개의 뱅크 내에서 여러 서브어레이를 동시에 활성화하고 액세스할 수 있도록 하는 더 고급 기법인 MASA(Multitude of Activated Subarrays)를 설계한다. 이는 레지스터 버퍼 활용도를 크게 향상시킨다.
- 활성화 및 프리차지 작업이 주로 서브어레이에 국한되어 있음을 활용해, 동일한 뱅크 내 서브어레이 간에도 이러한 작업을 겹쳐 처리할 수 있다.
- 메모리 코어가 아닌 주변 구조에 집중함으로써 면적 오버헤드를 최소화하여, SALP-2 및 MASA의 경우 면적 증가율이 <0.15% 이하로 낮게 유지된다.
- 멀티코어 시스템에서 SALP를 애플리케이션 인식 메모리 스케줄링과 조합함으로써 성능 향상과 공정성 향상을 더욱 강화한다.
실험 결과
연구 질문
- RQ1은행 수를 늘리지 않고도 DRAM 뱅크 내에서 서브어레이 수준의 병렬 처리를 활용해 요청의 순차화를 줄일 수 있는가?
- RQ2동일한 뱅크 내 다른 서브어레이에 동시에 액세스할 수 있도록 하기 위해 필요한 최소한의 아키텍처 변경은 무엇이며, 호환성과 낮은 면적 비용을 유지할 수 있는가?
- RQ3서브어레이 액세스 지연 시간을 겹쳐 처리함으로써 메모리 수준의 병렬 처리가 얼마나 향상되고, 쓰기 복구 오버헤드와 레지스터 버퍼 스래시링이 얼마나 감소하는가?
- RQ4서브어레이 수준의 병렬 처리가 싱글코어 및 멀티코어 시스템에서 다양한 워크로드에 미치는 영향은 어떠한가?
- RQ5SALP는 소프트웨어 수준의 메모리 스케줄링과 효과적으로 조합되어 공유 메모리 환경에서의 시스템 성능과 공정성을 더욱 향상시킬 수 있는가?
주요 결과
- SALP-1, SALP-2, MASA는 다양한 워크로드에서 평균적으로 싱글코어 시스템에서 각각 7%, 13%, 17% 향상된 성능을 달성한다.
- 멀티코어 시스템에서는 동일한 기법들이 각각 평균 15%, 16%, 20% 향상된 성능을 기록하여 뛰어난 확장성을 입증한다.
- 동일한 뱅크 내 다른 서브어레이에 동시에 액세스할 수 있도록 함으로써 은행 충돌의 영향을 줄여 효과적인 대역폭을 증가시키고 지연 시간을 감소시킨다.
- MASA는 여러 레지스터 버퍼를 동시에 활성화할 수 있도록 하여 레지스터 버퍼 히트율을 크게 향상시키고 레지스터 버퍼 스래시링을 줄인다.
- 더 나은 국지성과 순차화 감소로 인해 불필요한 레지스터 버퍼 활성화 및 프리차지 횟수를 줄여 메모리 에너지 효율성을 향상시킨다.
- SALP는 향후 계층적 은행 아키텍처를 사용하는 메모리 기술과도 호환되며, 산업계에서 이미 삼성 및 인텔 등에서 채택 및 검증된 바 있다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.