Skip to main content
QUICK REVIEW

[論文レビュー] Do Your Cores Play Nicely? A Portable Framework for Multi-core Interference Tuning and Analysis

Dan Iorga, Tyler Sorensen|arXiv (Cornell University)|Sep 13, 2018
Parallel Computing and Optimization Techniques参考文献 16被引用数 3
ひとこと要約

この論文は、さまざまなアーキテクチャ上で『敵プロセス』—マルチコア干渉を引き起こすように設計された合成ワークロード—の効果的なパラメータ設定を自動で特定する、ポータブルでブラックボックス型のオートチューニングフレームワークを提案する。ランダムサーチ、シミュレーテッドアニーリング、ベイズ最適化を用いてこれらのプロセスをチューニングすることで、ベンチマーク/チップの組み合わせの98%でスローダウンを達成し、手作業で最適化された敵プロセスと同等またはそれ以上の効果を発揮する。これにより、各プラットフォームにおけるマイクロアーキテクチャ的知識の必要性が解消される。

ABSTRACT

Multi-core architectures can be leveraged to allow independent processes to run in parallel. However, due to resources shared across cores, such as caches, distinct processes may interfere with one another, e.g. affecting execution time. Analysing the extent of this interference is difficult due to: (1) the diversity of modern architectures, which may contain different implementations of shared resources, and (2) the complex nature of modern processors, in which interference might arise due to subtle interactions. To address this, we propose a black-box auto-tuning approach that searches for processes that are effective at causing slowdowns for a program when executed in parallel. Such slowdowns provide lower bounds on worst-case execution time; an important metric in systems with real-time constraints. Our approach considers a set of parameterised "enemy" processes and "victim" programs, each targeting a shared resource. The autotuner searches for enemy process parameters that are effective at causing slowdowns in the victim programs. The idea is that victim programs behave as a proxy for shared resource usage of arbitrary programs. We evaluate our approach on: 5 different chips; 3 resources (cache, memory bus, and main memory); and consider several search strategies and slowdown metrics. Using enemy processes tuned per chip, we evaluate the slowdowns on the autobench and coremark benchmark suites and show that our method is able to achieve slowdowns in 98% of benchmark/chip combinations and provide similar results to manually written enemy processes.

研究の動機と目的

  • マルチコア干渉を測定するための手作業で設計された敵プロセスのポータビリティと効果性の制限を解消すること。
  • ターゲットプラットフォームの低レベルなマイクロアーキテクチャ的知識を必要とせずに、干渉を引き起こすプロセスパラメータを自動で発見できること。
  • ARMおよびx86を含む多様なマルチコアアーキテクチャに適用可能な統一的かつ再利用可能なフレームワークを構築し、最悪実行時間(WCET)の劣化を定量化すること。
  • オートチューニングされた敵プロセスが、実ベンチマーク上で測定可能なスローダウンを引き起こす点で、手作業で最適化されたプロセスと同等またはそれ以上の性能を示すかどうかを評価すること。
  • 複数の共有リソース(キャッシュ、メモリバス、メインメモリ)において、高影響度の干渉シナリオを信頼性高く同定できることを示すこと。

提案手法

  • フレームワークは、特定の共有リソース(例:ストライドパターンでアクセスされるキャッシュライン、繰り返しアクセスによるメモリ帯域幅)を標的とするパラメトリックな『敵テンプレート』を用いる。
  • ブラックボックス最適化戦略(ランダムサーチ、シミュレーテッドアニーリング、ベイズ最適化)を用いて、敵プロセスのパラメータ(例:バッファサイズ、ストライド、アクセスパターン)をチューニングし、『被害者』プログラムにおける最大のスローダウンを達成する。
  • 被害者プログラムは、特定の干渉経路(例:キャッシュ干渉のためのベクトル加算)に感受性が高いものとして選択され、実アプリケーションの挙動を代理として機能する。
  • 本手法は二段階のチューニングを実施する:まず、干渉経路ごとに敵パラメータを最適化し、次に最適化済みの敵プロセスを組み合わせて評価用の敵対的環境を構築する。
  • 探索戦略は、高スローダウン設定を効率的に発見できる能力に基づいて評価され、統計的有意性とスローダウンの大きさを指標に性能を測定する。
  • フレームワークは、ARMおよびx86を含む5種類のチップ上で評価され、標準ベンチマーク(autobench、coremark)を用い、先行研究における手作業でチューニングされた敵プロセスと比較された。

実験結果

リサーチクエスチョン

  • RQ1オートチューニングアプローチは、多様なマルチコアアーキテクチャにおいて、被害者プログラムに顕著なスローダウンを引き起こす敵プロセスのパラメータ設定を効果的に発見できるか?
  • RQ2オートチューニングされた敵プロセスは、スローダウンの大きさと統計的有意性の観点で、手作業で作成されたプロセスと比べてどの程度優れているか?
  • RQ3ランダムサーチ、シミュレーテッドアニーリング、ベイズ最適化のうち、どの最適化戦略が高影響度の干渉設定を最も効果的かつ効率的に発見できるか?
  • RQ4マイクロアーキテクチャの詳細が異なる複数のチップ間で、フレームワークのポータビリティはどの程度達成できるか?再実装を伴わず、同じまま利用可能か?
  • RQ5オートチューニングされた敵対的環境は、複数の共有リソース(キャッシュ、メモリバス、メインメモリ)において、測定可能で意味のある最悪実行時間の上限を一貫して得られるか?

主な発見

  • オートチューニングフレームワークは、評価したすべてのベンチマーク/チップの組み合わせの98%で測定可能なスローダウンを誘発し、多様なアーキテクチャにわたる高い信頼性を示した。
  • 52%のケースで、オートチューニングされた敵対的環境は、手作業で最適化された対応するプロセスよりも統計的に有意に高いスローダウンを達成した。残りの48%では重複する信頼区間を示した。
  • ターゲットプラットフォームの低レベルなマイクロアーキテクチャ的詳細にアクセスできない状況下でも、手作業で書かれた敵プロセスと同等またはそれ以上の性能を達成した。
  • ベイズ最適化とシミュレーテッドアニーリングは、ランダムサーチに比べ、収束速度と高スローダウン設定の発見効果において優れていた。
  • フレームワークは高いポータビリティを示した:オートチューニングを各プラットフォームで一度行うことで、同じ敵テンプレートと被害者プログラムを異なるチップで再利用可能であり、アーキテクチャ固有の手作業コーディングの必要性が排除された。
  • 本手法は、ドキュメンテーションからは容易に予測できない隠れた干渉パターンを効果的に検出でき、微細なマイクロアーキテクチャ的相互作用を解明する能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。