Skip to main content
QUICK REVIEW

[論文レビュー] IronMan: GNN-assisted Design Space Exploration in High-Level Synthesis via Reinforcement Learning

Nan Wu, Yuan Xie|arXiv (Cornell University)|Feb 16, 2021
Software Engineering Research参考文献 18被引用数 8
ひとこと要約

IronMan は、グラフニューラルネットワーク(GNN)ベースのパフォーマンス予測器(GPP)、強化学習(RL)駆動の設計空間探索エンジン(RLMD)、およびコードトランスフォーマー(CT)を統合するエンドツーエンドフレームワークであり、ハイレベルシンセシス(HLS)における柔軟で正確かつ高速な設計空間探索(DSE)を可能にする。メタヒューリスティック手法やHLSツールに比べ、最大400倍の高速化を達成し、DSP使用量を2.54倍削減し、遅延を最大6倍短縮する。ユーザー指定のDSP制約を完全に満たし、遺伝的アルゴリズムやシミュレーテッドアニーリングに比べ、LUT削減でそれぞれ12.7%および12.9%の優位性を示す。

ABSTRACT

Despite the great success of High-Level Synthesis (HLS) tools, we observe several unresolved challenges: 1) the high-level abstraction of programming styles in HLS sometimes conceals optimization opportunities; 2) existing HLS tools do not provide flexible trade-off (Pareto) solutions among different objectives and constraints; 3) the actual quality of the resulting RTL designs is hard to predict. To address these challenges, we propose an end-to-end framework, namelyIronMan. The primary goal is to enable a flexible and automated design space exploration (DSE), to provide either optimal solutions under user-specified constraints, or various trade-offs among different objectives (such as different types of resources, area, and latency). Such DSE either requires tedious manual efforts or is not achievable to attain these goals through existing HLS tools. There are three components in IronMan: 1) GPP, a highly accurate graph-neural-network-based performance and resource predictor; 2) RLMD, a reinforcement-learning-based multi-objective DSE engine that explores the optimal resource allocation strategy, to provide Pareto solutions between different objectives; 3) CT, a code transformer to assist RLMD and GPP, which extracts the data flow graph from original HLS C/C++ and automatically generates synthesizable code with HLS directives. The experimental results show that: 1) GPP achieves high prediction accuracy, reducing prediction errors of HLS tools by 10.9x in resource utilization and 5.7x in timing; 2) RLMD obtains optimal or Pareto solutions that outperform the genetic algorithm and simulated annealing by 12.7% and 12.9%, respectively; 3) IronMan is able to find optimized solutions perfectly matching various DSP constraints, with 2.54x fewer DSPs and up to 6x shorter latency than those of HLS tools while being up to 400x faster than the heuristic algorithms and HLS tools.

研究の動機と目的

  • ユーザー指定の制約の下で、複数の目的(例:面積、遅延、リソースタイプ)の間で柔軟なトレードオフを探索できる現在のHLSツールの限界を解消すること。
  • HLS設計における不規則なデータパスや複雑なループ構造に対して、既存のモデルが低い予測精度を示す問題を克服すること。
  • 制約最適化とパレート最適解の発見を両立できる、自動的かつ高精度で高速な設計空間探索(DSE)を可能にすること。
  • HLS合成および実装サイクルに費やす時間が長くなるのを防ぎ、代わりに高速なグラフベースの予測と学習駆動の探索によって置き換えること。
  • コード変換、パフォーマンス予測、RLベースの最適化を統合した包括的でスケーラブルなエンドツーエンドソリューションを提供すること。

提案手法

  • コードトランスフォーマー(CT)がC/C++ HLSコードを解析し、データフローダイアグラム(DFG)を抽出することで、後続処理のための制御およびデータ依存関係の構造的表現を可能にする。
  • グラフニューラルネットワーク(GNN)ベースのパフォーマンス予測器(GPP)が、完全なHLS合成を必要とせずに、生DFGから直接リソース使用量とタイミングを予測し、高い精度を達成する。
  • 強化学習(RL)エージェント(RLMD)が、報酬を多目的最適化に基づいて得ることで、DFGのノードに対して最適なディレクティブ割り当て(例:アンロール、パイプライン化)を学習し、DSEを実行する。
  • RLエージェントは探索と活用のバランスを保ち、GPPとの相互作用とユーザー指定の制約に基づいて、パレート最適解を発見する。
  • フレームワークはエンドツーエンドで訓練される:CTがDFGを生成し、GPPが迅速なフィードバックを提供し、RLMDは反復的にディレクティブ戦略を改善して目的を達成する。
  • RLエージェントのファインチューニングにより、ソリューションの品質と推論時間のトレードオフを可能にし、カスタマイズ可能なエピソード数を調整できる。

実験結果

リサーチクエスチョン

  • RQ1GNNベースの予測器は、完全な合成や実装を必要とせずに、生DFGからHLS設計の高精度なパフォーマンス予測を達成できるか?
  • RQ2強化学習エージェントは、HLSにおける複雑で多次元的な設計空間を効果的に探索し、面積、遅延、リソースタイプの観点からパレート最適解を発見できるか?
  • RQ3コードトランスフォーマー、GNN予測器、RLエージェントの統合により、従来のメタヒューリスティック手法や商業用HLSツールに比べ、より高速かつ正確なDSEが実現できるか?
  • RQ4ユーザー指定の制約(例:DSP制限)をどの程度満たしつつ、リソース使用量と遅延を最小限に抑えることができるか?
  • RQ5不規則なデータパスや複雑なループ構造を有する多様で現実的なHLSベンチマークにおいて、このフレームワークはどの程度スケーラブルか?

主な発見

  • GPPは、既存のHLSツールと比較して、リソース使用量の予測誤差を10.9倍、タイミングの予測誤差を5.7倍低減し、1秒未満で生DFGから高精度な予測を達成する。
  • ユーザー指定のDSP制約の下で最適化した場合、遺伝的アルゴリズム(GA)とシミュレーテッドアニーリング(SA)に比べ、LUT削減でそれぞれ12.7%および12.9%の優位性を示す。
  • IronManは、40件の実ケースベンチマークのうち97.5%でユーザー指定のDSP制約を満たし、ファインチューニングにより100%に向上。Vivado HLSと比較してDSP使用量を2.54倍削減した。
  • IronManは、Vivado HLSに比べ最大6倍の短い遅延を達成。Vivado HLSはDSP制約下での部分的アンロールにより遅延が増加する問題を抱える。
  • メタヒューリスティック手法やHLSツールに比べ、最大400倍の高速化を達成。推論時間は数秒で、大規模な設計空間の迅速な探索が可能。
  • ファインチューニングにより、LUT使用量がさらに8.9%削減され、GAと比較して7.7%、SAと比較して5.9%低いLUT利用率を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。