Skip to main content
QUICK REVIEW

[論文レビュー] Reducing overheads of dynamic scheduling on heterogeneous chips

Francisco Corbera, Andrés Rodríguez|arXiv (Cornell University)|Jan 14, 2015
Parallel Computing and Optimization Techniques参考文献 14被引用数 4
ひとこと要約

本論文は、統合型CPUとGPUを備えた非均質的チップにおけるオーバーヘッドを低減する動的スケジューリング最適化を提案する。不規則なワークロード(例:Barnes Hut)に焦点を当て、ホストスレッドの優先順位付けとOS固有のスケジューリング動作を活用することで、Intel Haswellでは最大84%、Samsung Exynos big.LITTLEでは最大57%のEnergy-Delay Product(EDP)低減を達成し、動的オフロード環境における性能とエネルギー効率を顕著に向上させた。

ABSTRACT

In recent processor development, we have witnessed the integration of GPU and CPUs into a single chip. The result of this integration is a reduction of the data communication overheads. This enables an efficient collaboration of both devices in the execution of parallel workloads. In this work, we focus on the problem of efficiently scheduling chunks of iterations of parallel loops among the computing devices on the chip (the GPU and the CPU cores) in the context of irregular applications. In particular, we analyze the sources of overhead that the host thread experiments when a chunk of iterations is offloaded to the GPU while other threads are executing concurrently other chunks on the CPU cores. We carefully study these overheads on different processor architectures and operating systems using Barnes Hut as a study case representative of irregular applications. We also propose a set of optimizations to mitigate the overheads that arise in presence of oversubscription and take advantage of the different features of the heterogeneous architectures. Thanks to these optimizations we reduce Energy-Delay Product (EDP) by 18% and 84% on Intel Ivy Bridge and Haswell architectures, respectively, and by 57% on the Exynos big.LITTLE.

研究の動機と目的

  • 統合GPUを備えた非均質的チップにおける不規則なアプリケーションの動的スケジューリングにおける性能劣化を解決すること。
  • GPUにイテレーションのチャンクをオフロードする際の主なオーバーヘッド要因(特にホストスレッドの再スケジューリング)を同定し、緩和すること。
  • 過剰割り当て環境下でのCPUコアとGPU間のロードバランシングおよびリソース利用効率を向上させること。
  • 異なるアーキテクチャ(Intel Ivy Bridge, Haswell, Exynos big.LITTLE)およびオペレーティングシステム(Windows, Linux)におけるスケジューリング最適化の影響を評価すること。
  • 標的的なスレッドスケジューリングと優先順位調整を通じて、実行時間を維持または改善しつつEnergy-Delay Product(EDP)を最小限に抑えること。

提案手法

  • Intel VTuneを用いて、Haswell上でGPUのハードウェアメトリクス(EUアクティビティ、アイドル、スタックサイクル、L3キャッシュミス)とさまざまなGPUチャンクサイズにおける有効スルーレットを分析する。
  • 統合GPUプラットフォームにおける動的スケジューリングのオーバーヘッド(カーネル起動、データ転送、ホストスレッドディスpatch)を測定し、分離する。
  • 特に過剰割り当て構成下のWindows環境において、再スケジューリングオーバーヘッドを低減するため、ホストスレッドの優先順位を向上させる。
  • Exynos big.LITTLEの低消費電力A7コアにスレッドをピン留めすることで、エネルギー消費を低減しつつ性能を維持する。
  • 優先順位の向上とコアピン留めの併用効果を、複数の構成とワークロードで評価し、EDP低減効果を検証する。
  • 性能とエネルギーのトレードオフを評価する代表的不規則アプリケーションとしてBarnes Hutベンチマークを用いる。

実験結果

リサーチクエスチョン

  • RQ1統合GPUを備えた非均質的チップにおける不規則なアプリケーションの動的スケジューリングにおける主なオーバーヘッド要因は何か?
  • RQ2オペレーティングシステム(Windows対Linux)は、過剰割り当て状況下でのホストスレッド再スケジューリングオーバーヘッドにどのように影響を与えるか?
  • RQ3Windows環境下のIntelプラットフォームにおいて、ホストスレッドの優先順位を向上させることで、実行時間およびエネルギー消費をどの程度低減できるか?
  • RQ4Exynos big.LITTLEアーキテクチャにおいて、ホストスレッドを低消費電力A7コアにピン留めすることで得られるエネルギーおよびパフォーマンスの利点は何か?
  • RQ5Barnes Hutのような不規則ワークロードにおいて、GPUにオフロードするチャンクサイズがGPUのパフォーマンスおよび全体のEDPにどのように影響するか?

主な発見

  • Intel Haswell(Windows)では、ホストスレッドの優先順位を向上させることで、ベースラインの動的スケジューリングと比較してEnergy-Delay Product(EDP)が84%低減した。
  • Intel Ivy Bridge(Windows)では、ホストスレッドの優先順位向上によりEDPが18%低減し、過剰割り当て環境下で顕著な改善が得られた。
  • Exynos 5 big.LITTLE(Linux)では、ホストスレッドをA7コアにピン留めすることで、標準的な動的スケジューリングと比較してEDPが46%低減した。
  • Exynosでは、ホストスレッドの優先順位向上とA7コアピン留めを併用することで、さらに7.8%のEDP低減が達成され、合計で57%のEDP低減を実現した。
  • ExynosのLinuxスケジューラは、優先順位調整なしで過剰割り当てを効果的に管理でき、結果としてスレッドピン留めが主な最適化手法となった。
  • 過剰割り当てでない構成(例:3+1)では、ホストスレッドの優先順位を向上させても効果が限定的であり、リソースが未使用状態の場合はオーバーヘッドが顕著でないことが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。