Skip to main content
QUICK REVIEW

[論文レビュー] Coarse-Grain Performance Estimator for Heterogeneous Parallel Computing Architectures like Zynq All-Programmable SoC

Daniel Jiménez-González, Carlos Álvarez|arXiv (Cornell University)|Aug 27, 2015
Parallel Computing and Optimization Techniques参考文献 11被引用数 8
ひとこと要約

この論文では、Zynq All-Programmable SoC向けの粗粒なパフォーマンス推定器を提示しており、OmpSsアプリケーションコードと合成推定値のみを用いて、迅速なハードウェア/ソフトウェア共同設計意思決定を可能にする。実行時タスクスケジューリングと共同設計の探索を統合することで、共同設計意思決定の時間を数時間から数分に短縮し、異種並列ワークロードにおいてほぼ最適のパフォーマンスを達成する。

ABSTRACT

Heterogeneous computing is emerging as a mandatory requirement for power-efficient system design. With this aim, modern heterogeneous platforms like Zynq All-Programmable SoC, that integrates ARM-based SMP and programmable logic, have been designed. However, those platforms introduce large design cycles consisting on hardware/software partitioning, decisions on granularity and number of hardware accelerators, hardware/software integration, bitstream generation, etc. This paper presents a performance parallel heterogeneous estimation for systems where hardware/software co-design and run-time heterogeneous task scheduling are key. The results show that the programmer can quickly decide, based only on her/his OmpSs (OpenMP + extensions) application, which is the co-design that achieves nearly optimal heterogeneous parallel performance, based on the methodology presented and considering only synthesis estimation results. The methodology presented reduces the programmer co-design decision from hours to minutes and shows high potential on hardware/software heterogeneous parallel performance estimation on the Zynq All-Programmable SoC.

研究の動機と目的

  • Zynq All-Programmable SoCのような異種コンピューティングプラットフォームにおける長時間の設計サイクル、すなわちハードウェア/ソフトウェア分割、アクセラレータの粒度、ビットストリーム生成の問題を解決すること。
  • 自動化されたパフォーマンス推定を通じて、ハードウェア/ソフトウェア共同設計意思決定に要する時間を数時間から数分に短縮すること。
  • OmpSsアプリケーションコードと合成推定値のみを用いて、プログラマーが近似的に最適な共同設計構成を素早く特定できるようにすること。
  • ARMベースのSMPとプログラマブルロジックを組み合わせたシステムにおける実行時異種タスクスケジューリングとパフォーマンス予測を支援すること。
  • 完全な実装サイクルを必要としない、スケーラブルで実用的な異種並列アーキテクチャにおけるパフォーマンス推定のための手法を提供すること。

提案手法

  • OmpSsアプリケーションコードを入力として、タスクレベルの並列性とデータ依存関係をモデル化する。
  • 合成結果に基づく粗粒な推定モデルを適用し、ハードウェアアクセラレータとソフトウェアタスクのパフォーマンスを予測する。
  • 実行時スケジューリングヒューリスティクスを統合し、ARMコアとFPGAベースのアクセラレータへのタスクマッピングをシミュレートする。
  • 完全なハードウェア実装を回避するため、既存の合成推定値を活用し、ソリューションに至るまでの時間を短縮する。
  • 通信オーバーヘッドとメモリアクセスパターンをモデル化することで、予測精度を向上させる。
  • フレームワークは、実世界のワークロードとパフォーマンスメトリクスを用いて、Zynq All-Programmable SoCで検証された。

実験結果

リサーチクエスチョン

  • RQ1粗粒なパフォーマンス推定器は、Zynq All-Programmable SoCにおけるハードウェア/ソフトウェア共同設計意思決定に要する時間を短縮できるか?
  • RQ2合成推定値のみで、異種並列ワークロードにおいてほぼ最適のパフォーマンスを予測できるか、その程度はどの程度か?
  • RQ3完全なハードウェア実装を経ずに、推定器は共同設計意思決定を効果的に支援できるか?
  • RQ4この手法は、初期段階の設計において実行時タスクスケジューリング意思決定を支援できるか?
  • RQ5OmpSsコードと合成データのみに依存する場合、パフォーマンス予測の正確さはどの程度か?

主な発見

  • パフォーマンス推定器により、共同設計意思決定の時間が数時間から数分に短縮され、設計プロセスが顕著に高速化された。
  • 適切なハードウェア/ソフトウェア分割とアクセラレータ構成を特定することで、この手法はほぼ最適のパフォーマンスを達成した。
  • 完全な実装サイクルを回避するため、OmpSsコードと合成推定値のみを用いても、推定器は高い正確性を示した。
  • 初期段階のパフォーマンスモデリングを通じて、実行時タスクスケジューリングの支援が効果的に行えるようになった。
  • この手法は、Zynq All-Programmable SoCのような異種コンピューティングプラットフォームにおける実用的応用の強い可能性を示した。
  • 結果から、合成に基づく推定が、最小限のオーバーヘッドで共同設計意思決定を支援するのに十分であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。