Skip to main content
QUICK REVIEW

[논문 리뷰] Do Your Cores Play Nicely? A Portable Framework for Multi-core Interference Tuning and Analysis

Dan Iorga, Tyler Sorensen|arXiv (Cornell University)|2018. 09. 13.
Parallel Computing and Optimization Techniques참고 문헌 16인용 수 3
한 줄 요약

이 논문은 다양한 아키텍처에서 '적대적 프로세스'(멀티코어 간섭을 유도하기 위해 설계된 합성 워크로드)의 효과적인 파라미터 설정을 자동으로 식별할 수 있는 이식 가능하고 블랙박스 자동 튜닝 프레임워크를 제안한다. 랜덤 서치, 시뮬레이티드 어닐링, 베이지안 최적화를 사용하여 이러한 프로세스를 튜닝함으로써, 98%의 벤치마크/칩 조합에서 정지율을 유도하며, 수작업으로 작성된 적대적 프로세스의 효과성에 맞추거나 초월한다. 이는 각 플랫폼에 대한 마이크로아키텍처 전문 지식이 필요로 하지 않음을 의미한다.

ABSTRACT

Multi-core architectures can be leveraged to allow independent processes to run in parallel. However, due to resources shared across cores, such as caches, distinct processes may interfere with one another, e.g. affecting execution time. Analysing the extent of this interference is difficult due to: (1) the diversity of modern architectures, which may contain different implementations of shared resources, and (2) the complex nature of modern processors, in which interference might arise due to subtle interactions. To address this, we propose a black-box auto-tuning approach that searches for processes that are effective at causing slowdowns for a program when executed in parallel. Such slowdowns provide lower bounds on worst-case execution time; an important metric in systems with real-time constraints. Our approach considers a set of parameterised "enemy" processes and "victim" programs, each targeting a shared resource. The autotuner searches for enemy process parameters that are effective at causing slowdowns in the victim programs. The idea is that victim programs behave as a proxy for shared resource usage of arbitrary programs. We evaluate our approach on: 5 different chips; 3 resources (cache, memory bus, and main memory); and consider several search strategies and slowdown metrics. Using enemy processes tuned per chip, we evaluate the slowdowns on the autobench and coremark benchmark suites and show that our method is able to achieve slowdowns in 98% of benchmark/chip combinations and provide similar results to manually written enemy processes.

연구 동기 및 목표

  • 멀티코어 간섭 측정을 위한 수작업으로 설계된 적대적 프로세스의 이식성과 효과성에 한계가 있음을 해결하기 위해.
  • 대상 플랫폼의 저수준 마이크로아키텍처 지식이 없이도 간섭을 유도하는 프로세스 파라미터를 자동으로 탐색할 수 있도록 하기 위해.
  • ARM 및 x86을 포함한 다양한 멀티코어 아키텍처에 적용 가능한 통합형, 재사용 가능한 프레임워크를 개발하여 최악의 실행 시간(WCET) 저하를 정량화하기 위해.
  • 자동 튜닝된 적대적 프로세스가 실제 벤치마크에서 측정 가능한 정지율을 유도하는 데 있어 수작업으로 작성된 프로세스와 동등하거나 이를 초월하는지 평가하기 위해.
  • 공유 리소스(캐시, 메모리 버스, 주 메모리) 여러 가지에서 고영향 간섭 시나리오를 신뢰성 있게 식별할 수 있는지 입증하기 위해.

제안 방법

  • 프레임워크는 특정 공유 리소스를 타겟으로 하는 파라미터화된 '적대적 템플릿'을 사용한다. 예를 들어, 스트라이드 패턴으로 액세스하는 캐시 라인 또는 반복 액세스로 인한 메모리 대역폭을 대상으로 한다.
  • 적대적 프로세스 파라미터(예: 버퍼 크기, 스트라이드, 액세스 패턴)를 최적화하기 위해 블랙박스 최적화 전략(랜덤 서치, 시뮬레이티드 어닐링, 베이지안 최적화)을 적용하여 '피해자' 프로그램에서 최대 정지율을 유도한다.
  • 피해자 프로그램는 특정 간섭 경로(예: 캐시 간섭을 위한 벡터 덧셈)에 민감하도록 선택되며, 실제 응용 프로그램 동작을 대신하는 프록시 역할을 한다.
  • 이 방법은 이중 수준 튜닝을 수행한다: 먼저 간섭 경로별로 적대적 프로세스 파라미터를 최적화하고, 그 다음 최적화된 적대적 프로세스들을 조합하여 평가용 악성 환경을 구성한다.
  • 검색 전략은 높은 정지율 설정을 효율적으로 찾는 능력에 따라 평가되며, 통계적 유의성과 정지율의 크기를 측정 기준으로 삼는다.
  • 프레임워크는 ARM 및 x86 포함 5종의 칩에서 평가되었으며, 표준 벤치마크(autobench, coremark)를 사용하고 이전 연구에서 제안된 수작업 튜닝된 적대적 프로세스와 비교되었다.

실험 결과

연구 질문

  • RQ1자동 튜닝 접근법이 다양한 멀티코어 아키텍처에서 피해자 프로그램에 상당한 정지율을 유도하는 적대적 프로세스의 파라미터 설정을 효과적으로 발견할 수 있는가?
  • RQ2자동 튜닝된 적대적 프로세스는 수작업으로 작성된 것과 비교해 정지율 유도 능력과 통계적 유의성 측면에서 어떻게 다른가?
  • RQ3랜덤 서치, 시뮬레이티드 어닐링, 베이지안 최적화 중 어떤 최적화 전략이 고영향 간섭 설정을 가장 효과적이고 효율적으로 발견하는가?
  • RQ4다양한 마이크로아키텍처 세부 사항이 존재하는 칩 간에 프레임워크의 이식성이 얼마나 높은가? 재구현 없이도 가능한가?
  • RQ5자동 튜닝된 악성 환경이 캐시, 메모리 버스, 주 메모리 등 여러 공유 리소스에서 측정 가능하고 의미 있는 최악의 실행 시간 한계를 신뢰성 있게 생성하는가?

주요 결과

  • 자동 튜닝 프레임워크는 평가한 모든 벤치마크 및 칩 조합 중 98%에서 측정 가능한 정지율을 유도하여 다양한 아키텍처에서 높은 신뢰성을 입증했다.
  • 52%의 경우에서 자동 튜닝된 악성 환경은 수작업 튜닝된 대안보다 통계적으로 유의미하게 높은 정지율을 기록했으며, 나머지 48%는 겹치는 신뢰구간을 보였다.
  • 대상 플랫폼의 저수준 마이크로아키텍처 세부 정보에 접근할 수 없음에도 불구하고, 수작업으로 작성된 적대적 프로세스와 비교해 유사하거나 더 나은 성능을 달성했다.
  • 베이지안 최적화와 시뮬레이티드 어닐링은 수렴 속도와 높은 정지율 설정을 찾는 데서 랜덤 서치를 능가했다.
  • 프레임워크는 강력한 이식성을 보였다: 자동 튜닝 후 각 플랫폼에 맞게 적응된 동일한 적대적 템플릿과 피해자 프로그램을 다양한 칩에서 재사용할 수 있었으며, 아키텍처에 특화된 수작업 코딩이 필요로 하지 않았다.
  • 문서화된 정보로는 쉽게 예측할 수 없는 숨겨진 간섭 패턴을 성공적으로 탐지하여, 미세한 마이크로아키텍처 상호작용을 드러내는 능력을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.