Skip to main content
QUICK REVIEW

[논문 리뷰] Pangloss: a novel Markov chain prefetcher

Philippos Papaphilippou, Paul H. J. Kelly|arXiv (Cornell University)|2019. 06. 03.
Parallel Computing and Optimization Techniques참고 문헌 8인용 수 5
한 줄 요약

Pangloss는 메모리 주소 간의 델타 전이를 페이지별로 추적하는 세트-연결된 캐시를 사용하여 복잡한 액세스 패턴에서 정확도를 향상시키는 하드웨어 효율적인 마르코프 체인 기반 프리패칭 기법이다. 멀티레벨 프리패칭에서 KPCP와 BOP 대비 각각 6.8% 및 8.4%의 기하 평균 속도 향상을 달성하였으며, 프리패칭이 없는 경우 대비 40.4%의 속도 향상을 기록했고, 64 KB 공간 예산 내에 머물렀다.

ABSTRACT

We present Pangloss, an efficient high-performance data prefetcher that approximates a Markov chain on delta transitions. With a limited information scope and space/logic complexity, it is able to reconstruct a variety of both simple and complex access patterns. This is achieved by a highly-efficient representation of the Markov chain to provide accurate values for transition probabilities. In addition, we have added a mechanism to reconstruct delta transitions originally obfuscated by the out-of-order execution or page transitions, such as when streaming data from multiple sources. Our single-level (L2) prefetcher achieves a geometric speedup of 1.7% and 3.2% over selected state-of-the-art baselines (KPCP and BOP). When combined with an equivalent for the L1 cache (L1 & L2), the speedups rise to 6.8% and 8.4%, and 40.4% over non-prefetch. In the multi-core evaluation, there seems to be a considerable performance improvement as well.

연구 동기 및 목표

  • 페이지 경계와 순서가 뒤바뀐 실행으로 인해 델타 전이가 왜곡되는 상황에서 마르코프 체인 모델링의 정확도 저하 문제를 해결하기 위해.
  • 복잡한 액세스 패턴에 대해 정확한 전이 확률 지표를 유지하면서도 공간 효율적이고 하드웨어 우아한 마르코프 체인 표현 방식을 설계하기 위해.
  • 페이지별 델타 전이 추적을 통해 정확도를 향상시키고, 동시에 압축된 연관 구조를 사용해 글로벌 의사결정을 가능하게 하여 프리패칭 정확도와 성능을 향상시키기 위해.
  • 실제 공간 및 논리 복잡도 제약 조건 하에서 단일 및 멀티코어 워크로드에서 프리패처의 성능을 평가하기 위해.

제안 방법

  • 시스템은 현재 델타로 인덱싱된 세트-연결된 델타 캐시를 사용하여 빈도가 높은 다음 델타와 그 확률을 저장한다.
  • 페이지 전이를 해결하기 위해 페이지 식별자를 추적하는 별도의 페이지 캐시를 유지하여, 페이지 간 유효하지 않은 전이를 방지하고 페이지별 델타 추적을 가능하게 한다.
  • 이동 히어리스틱은 확률이 1/3을 초과하는 전환만 선택하여, 각 상태당 후보 프리패칭 수를 두 개 이내로 제한함으로써 저지연 의사결정을 가능하게 한다.
  • 델타 전이에 대해 빈도 기반 인접 행렬을 사용하여 마르코프 모델을 구축하고, 밀도가 낮은 특성을 연관 구조를 통해 활용하여 면적과 복잡도를 감소시킨다.
  • L1에는 10비트 델타 크기(512개 오프셋), L2에는 7비트(64개 오프셋)를 사용하며, 16-way 연관성과 7비트 LFU 카운터를 사용해 액세스 빈도를 추적한다.
  • 프리패처는 46개의 벤치마크 트레이스를 사용해 ChampSim에서 평가되었으며, KPCP와 BOP와의 비교를 위해 단일레벨(L2) 및 멀티레벨(L1 & L2) 구성에서 평가되었다.

실험 결과

연구 질문

  • RQ1복잡한 메모리 액세스 패턴에서 기존 최신 기술 대비 성능을 뛰어넘는 압축형 하드웨어 우아한 마르코프 체인 표현 방식이 가능한가?
  • RQ2페이지 경계와 순서가 뒤바뀐 실행으로 인해 글로벌 델타 스트림이 왜곡될 경우, 페이지별 델타 추적은 유효한 전이 확률을 얼마나 잘 복원하는가?
  • RQ3동일한 마르코프 기반 기법을 사용해 L1과 L2 프리패칭을 조합했을 때의 성능 향상은 어떠한가? 그리고 멀티코어 워크로드에서 이는 어떻게 스케일링되는가?
  • RQ4기존의 스트라이드 또는 거리 기반 프리패칭과 비교했을 때, 제안된 모델은 거짓 긍정을 얼마나 줄이고 정확도를 향상시키는가?

주요 결과

  • 멀티레벨 Pangloss(L1 & L2)는 단일코어 평가에서 KPCP 대비 6.8% 기하 평균 속도 향상, BOP 대비 8.4% 향상을 기록했다.
  • 비프리패칭 대비 기하 평균 속도 향상은 40.4%로, 기준 프리패처들을 크게 능가했다.
  • 단일레벨 L2 버전은 KPCP 대비 1.7%, BOP 대비 3.2%의 속도 향상을 기록했으며, 비프리패칭 대비 33.5%의 속도 향상을 기록했다.
  • 총 면적 소비는 단일코어 모드에서 59.4 KB로, 64 KB 경쟁 예산을 크게 초과하지 않았으며, 멀티코어로 확장 시 4배로 효율적으로 확장되었다.
  • 낮은 연관성과 확률 기반의 이동 히어리스틱을 통해 낮은 논리 복잡도를 유지하여 효율적인 하드웨어 구현을 가능하게 했다.
  • 다중 프로그램 평가에서 일관된 성능 향상이 관찰되었으며, 멀티레벨 프리패처는 다양한 프로그램 믹스에서 KPCP를 능가하는 성능을 기록했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.