Skip to main content
QUICK REVIEW

[논문 리뷰] LazyPIM: Efficient Support for Cache Coherence in Processing-in-Memory Architectures

Amirali Boroumand, Saugata Ghose|arXiv (Cornell University)|2017. 06. 10.
Parallel Computing and Optimization Techniques참고 문헌 14인용 수 17
한 줄 요약

LazyPIM는 처리-메모리(PIM) 아키텍처를 위한 사전적, 서명 기반 캐시 일관성 메커니즘을 제안하며, 커널 완료 시까지 일관성 검사를 배치함으로써 외부 메모리 트래픽을 감소시킨다. 충돌을 감지하기 위해 압축된 일관성 서명을 사용하고 필요할 경우에만 롤백함으로써, LazyPIM은 평균 성능을 19.6% 향상시키고, 외부 메모리 트래픽을 30.9% 감소시키며, 에너지 소비를 18.0% 절감한다. 이는 이전 방법들에 비해 향상된 성능이다.

ABSTRACT

Processing-in-memory (PIM) architectures have seen an increase in popularity recently, as the high internal bandwidth available within 3D-stacked memory provides greater incentive to move some computation into the logic layer of the memory. To maintain program correctness, the portions of a program that are executed in memory must remain coherent with the portions of the program that continue to execute within the processor. Unfortunately, PIM architectures cannot use traditional approaches to cache coherence due to the high off-chip traffic consumed by coherence messages, which, as we illustrate in this work, can undo the benefits of PIM execution for many data-intensive applications. We propose LazyPIM, a new hardware cache coherence mechanism designed specifically for PIM. Prior approaches for coherence in PIM are ill-suited to applications that share a large amount of data between the processor and the PIM logic. LazyPIM uses a combination of speculative cache coherence and compressed coherence signatures to greatly reduce the overhead of keeping PIM coherent with the processor, even when a large amount of sharing exists.We find that LazyPIM improves average performance across a range of data-intensive PIM applications by 19.6%, reduces off-chip traffic by 30.9%, and reduces energy consumption by 18.0%, over the best prior approaches to PIM coherence.

연구 동기 및 목표

  • 기존 캐시 일관성 프로토콜이 PIM 아키텍처에서 유발하는 높은 외부 메모리 트래픽 문제를 해결하여, PIM의 성능 이점을 해치지 않도록 하는 것.
  • 프로세서와 PIM 코어 간의 높은 데이터 공유를 가진 데이터 집약적 워크로드를 위한 효율적이고 확장 가능한 PIM 캐시 일관성 구현을 가능하게 하는 것.
  • 일관성 관련 통신을 최소화하면서도 기존의 다중 스레드 프로그래밍 모델과의 호환성을 유지하는 것.
  • 정확성과 성능을 희생시키지 않고 에너지 소비와 외부 메모리 대역폭 사용을 줄이는 것.

제안 방법

  • LazyPIM는 사전적 실행을 사용하여, PIM 코어가 즉각적인 일관성 요청 없이도 일관성 권한을 가정한다.
  • 커널 실행 동안 모든 데이터 업데이트를 PIM 캐시에 사전적으로 유지한다.
  • 커널 완료 후, PIM 코어는 충돌을 확인하기 위해 압축된 일관성 서명을 프로세서에게 전송한다.
  • 프로세서는 이 서명을 사용하여 PIM 커널이 읽은 이후로 프로세서가 어떤 데이터도 수정했는지 감지한다.
  • 충돌이 감지되면, 프로세서는脏 라인을 플러시하고 PIM 커널을 재실행한다.
  • 압축된 서명(예: 2K~8K 비트)의 사용으로 잘못된 경고 수가 감소하고 외부 메모리 트래픽이 최소화된다.

실험 결과

연구 질문

  • RQ1사전적, 배치 처리 기반의 일관성 메커니즘이 정확성을 희생시키지 않고 PIM 아키텍처에서 외부 메모리 트래픽을 줄일 수 있는가?
  • RQ2압축된 일관성 서명 기반의 충돌 감지 기법이 잘못된 경고와 롤백을 최소화하는 데 얼마나 효과적인가?
  • RQ3높은 데이터 공유를 가진 데이터 집약적 PIM 워크로드에서 사전적 일관성 기법이 성능과 에너지 효율성을 유지하는 데 얼마나 효과적인가?
  • RQ4서명 크기의 선택이 충돌 감지 정확도와 외부 메모리 통신 오버헤드 사이의 상호 교환 관계에 어떻게 영향을 미치는가?

주요 결과

  • LazyPIM는 데이터 집약적 PIM 응용 프로그램에서 이전 최고의 일관성 기법들에 비해 평균 성능을 19.6% 향상시켰다.
  • 일관성 검사를 배치하고 실시간 일관성 메시지 교환을 최소화함으로써 외부 메모리 트래픽을 30.9% 감소시켰다.
  • 통신 오버헤드 감소와 재실행 횟수 감소로 인해 에너지 소비가 18.0% 감소했다.
  • 8K비트 서명을 사용하면 평균적으로 충돌률이 30% 감소하지만, 외부 메모리 트래픽은 30~33% 증가하여, 2K비트 서명이 종합적으로 더 효율적이다.
  • 2K비트 서명 설정은 모든 평가 대상 워크로드에서 성능과 통신 비용 사이의 최적 균형을 달성했다.
  • LazyPIM는 기존의 다중 스레드 프로그래밍 모델을 유지하면서도 정확하고 고성능의 PIM 실행을 가능하게 했으며, 이는 이전 방법들이 제한적인 프로그래밍 모델을 요구했던 것과 대조된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.