Skip to main content
QUICK REVIEW

[논문 리뷰] Banshee: Bandwidth-Efficient DRAM Caching Via Software/Hardware Cooperation

Xiangyao Yu, Christopher J. Hughes|arXiv (Cornell University)|2017. 04. 10.
Parallel Computing and Optimization Techniques참고 문헌 29인용 수 8
한 줄 요약

Banshee는 소프트웨어/하드웨어 공동 설계된 DRAM 캐시로, 패키지 내 및 패키지 외부 DRAM의 대역폭 효율성을 최적화하기 위해 PTE/TLB 기반 페이지 매핑을 통해 태그 검색 오버헤드를 제거하고, 대역폭 인식형 샘플링 주파수 기반 교체 정책을 적용한다. 이는 패키지 내 DRAM 트래픽을 35.8% 감소시키며, 최고의 이전 설계인 Alloy Cache 대비 성능을 15.0% 향상시킨다. 또한 낮은 지연 시간을 유지하면서 2MB 크기의 큰 페이지도 지원한다.

ABSTRACT

Putting the DRAM on the same package with a processor enables several times higher memory bandwidth than conventional off-package DRAM. Yet, the latency of in-package DRAM is not appreciably lower than that of off-package DRAM. A promising use of in-package DRAM is as a large cache. Unfortunately, most previous DRAM cache designs mainly optimize for hit latency and do not consider off-chip bandwidth efficiency as a first-class design constraint. Hence, as we show in this paper, these designs are suboptimal for use with in-package DRAM. We propose a new DRAM cache design, Banshee, that optimizes for both in- and off-package DRAM bandwidth efficiency without degrading access latency. The key ideas are to eliminate the in-package DRAM bandwidth overheads due to costly tag accesses through virtual memory mechanism and to incorporate a bandwidth-aware frequency-based replacement policy that is biased to reduce unnecessary traffic to off-package DRAM. Our extensive evaluation shows that Banshee provides significant performance improvement and traffic reduction over state-of-the-art latency-optimized DRAM cache designs.

연구 동기 및 목표

  • 기존 DRAM 캐시 설계가 외부 및 패키지 내 DRAM 대역폭 사용을 우선시하지 않아 발생하는 대역폭 비효율 문제를 해결하기 위해.
  • PTE/TLB 기반 페이지 매핑을 통해 패키지 내 DRAM 캐시에서 비용이 많이 드는 태그 액세스 및 메타데이터 업데이트 트래픽을 제거하기 위해.
  • 패키지 내 및 외부 DRAM으로의 불필요한 데이터 및 메타데이터 이동을 최소화하는 대역폭 효율적인 교체 정책을 설계하기 위해.
  • 하드웨어 태그 버퍼를 활용한 지연된 배치 업데이트 메커니즘을 통해 TLB 일관성 문제를 단순화하고, 2MB 크기의 큰 페이지 지원을 효율적으로 구현하기 위해.
  • 특히 대역폭 제약이 있는 메모리 기반 워크로드에서 접근 지연을 희생시키지 않으면서도 높은 대역폭 효율성을 달성하기 위해.

제안 방법

  • PTE와 TLB를 사용하여 DRAM 캐시 존재 정보를 저장함으로써 별도의 태그 저장소가 필요 없게 하고, 태그 검색 트래픽을 줄임.
  • 하드웨어가 관리하는 주파수 기반 교체(FBR) 정책을 적용하여 핫 페이지만 캐시함으로써 교체 트래픽을 감소시킴.
  • 주기적으로 빈도 카운터 업데이트를 샘플링함—메모리 액세스의 일부만 읽고 쓰며, 대역폭 오버헤드를 최소화하면서도 예측 정확도를 유지함.
  • 메모리 컨트롤러에 태그 버퍼를 도입하여 실시간 매핑 변경을 추적하고, 버퍼가 가득 찰 경우에만 페이지 테이블 및 TLB에 대량 업데이트를 트리거함.
  • 버퍼 오버플로우 시까지 페이지 테이블 및 TLB 업데이트를 연기하는 지연된 TLB 일관성 메커니즘을 도입하여 비용을 분산시키고 일관성 유지의 복잡성을 단순화함.
  • 대역폭 인식형 FBR 정책과 샘플링을 통해 교체 오버헤드를 줄여 2MB 페이지를 효율적으로 지원함.

실험 결과

연구 질문

  • RQ1패키지 내 및 패키지 외부 DRAM에 대해 접근 지연을 훼손하지 않으면서도 높은 대역폭 효율성을 달성할 수 있는 DRAM 캐시 설계가 가능한가?
  • RQ2페이지 크기 단위의 DRAM 캐시에서 태그 검색 및 메타데이터 업데이트 트래픽을 어떻게 제거하거나 최소화할 수 있는가?
  • RQ3샘플링과 하드웨어 지원을 통해 주파수 기반 교체 정책을 대역폭 효율적으로 만들 수 있는가?
  • RQ4PTE/TLB 기반 DRAM 캐시에서 TLB 일관성을 어떻게 단순화하여 고비용 오버헤드 없이 효율적인 교체를 가능하게 할 수 있는가?
  • RQ5대역폭 최적화된 DRAM 캐시에서 2MB 크기의 큰 페이지를 얼마나 효율적으로 지원할 수 있는가?

주요 결과

  • Banshee는 최고의 이전 설계인 Alloy Cache 대비 패키지 내 DRAM 트래픽을 35.8% 감소시켜 대역폭 효율성을 크게 향상시킴.
  • Banshee는 대역폭 제약 조건 하에서 Alloy Cache(최고 성능 기반선) 대비 15.0%의 성능 향상을 달성함.
  • 빈도 카운터 업데이트를 10% 이하의 비율로 샘플링할 경우, 미스율 증가 폭은 미미하지만 카운터 업데이트 트래픽은 거의 무시할 수 있을 정도로 감소함.
  • Banshee의 4-way 연쇄 설계는 30.9%의 미스율을 기록하며, 4-way 이상으로 늘일 경우 수익 감소 효과가 나타나므로 기본 설정으로서의 타당성을 입증함.
  • Banshee는 기존의 페이지 기반 캐시 설계에서 야기하는 높은 교체 오버헤드를 극복하고, 효율적인 2MB 페이지 지원을 가능하게 함.
  • 하드웨어 태그 버퍼를 활용한 지연된 TLB 일관성 메커니즘은 일관성 유지 비용을 감소시켜 확장 가능하고 효율적인 교체를 가능하게 함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.