[論文レビュー] OpenABC-D: A Large-Scale Dataset For Machine Learning Guided Integrated Circuit Synthesis
本論文では、29個のオープンソースハードウェア設計に対して1500回の論理合成ランを実行した結果、87万件のアンドインバーターグラフ(AIGs)から成る大規模かつラベル付きのデータセット、OpenABC-Dを紹介する。ラベルには最適化済みノード数や遅延が含まれる。著者らは、グラフニューラルネットワーク(GCNs)を用いた合成レシピの品質(QoR)予測ベンチマークを実施し、テストセットで平均二乗誤差(MSE)0.579を達成した。また、GCNsがAIGから意味のある構造的・機能的埋め込みを学習できることを示した。
Logic synthesis is a challenging and widely-researched combinatorial optimization problem during integrated circuit (IC) design. It transforms a high-level description of hardware in a programming language like Verilog into an optimized digital circuit netlist, a network of interconnected Boolean logic gates, that implements the function. Spurred by the success of ML in solving combinatorial and graph problems in other domains, there is growing interest in the design of ML-guided logic synthesis tools. Yet, there are no standard datasets or prototypical learning tasks defined for this problem domain. Here, we describe OpenABC-D,a large-scale, labeled dataset produced by synthesizing open source designs with a leading open-source logic synthesis tool and illustrate its use in developing, evaluating and benchmarking ML-guided logic synthesis. OpenABC-D has intermediate and final outputs in the form of 870,000 And-Inverter-Graphs (AIGs) produced from 1500 synthesis runs plus labels such as the optimized node counts, and de-lay. We define a generic learning problem on this dataset and benchmark existing solutions for it. The codes related to dataset creation and benchmark models are available athttps://github.com/NYU-MLDA/OpenABC.git. The dataset generated is available athttps://archive.nyu.edu/handle/2451/63311
研究の動機と目的
- 電子設計自動化(EDA)分野における機械学習を活用した論理合成の分野で、標準化された大規模データセットが不足している問題に対処すること。
- 再現可能なMLモデルのベンチマークが可能な、現実的で機能豊富なデータセットを提供すること。
- 技術独立型論理合成における品質の結果(QoR)を予測するMLモデルの開発と評価を可能にすること。
- ラベル付き出力を備えた標準的でオープンかつスケーラブルなデータセットを提供することで、将来的なEDA分野におけるML研究の基盤を築くこと。
- AIGにおけるグラフニューラルネットワークの表現能力を検証し、ネットリストメトリクスの予測やIP機能分類を目的とした学習を実施すること。
提案手法
- オープンソースのABCツールを用いて、29個のオープンソースハードウェアIPに対して1500回の合成ランを実行し、87万件のAIGと中間的・最終的出力を得た。
- 各AIGサンプルには、最適化済みノード数、遅延、深さといったラベルが付与されており、回帰および分類タスクが可能である。
- グラフ畳み込みネットワーク(GCN)を用いて、AIG構造と合成レシピの埋め込みを入力として、QoRメトリクスを予測するモデルを訓練した。
- モデルアーキテクチャでは、グラフレベルとレシピレベルの埋め込みを連結し、その後に全結合層を用いて回帰を実行した。
- IP分類のためには、2層のGCNをカテゴリカルクロスエントロピー損失関数を用いて訓練した。また、学習済み埋め込みの可視化にはt-SNEを用いた。
- すべての実験において、Adam最適化手法を用い、学習率(0.001)、バッチサイズ(64)、80エポックというハイパーパrameterを設定した。
実験結果
リサーチクエスチョン
- RQ1オープンソースハードウェアIPのAIGから得た大規模かつ現実的なデータセットは、論理合成分野におけるMLモデルの再現可能なベンチマークを可能にするか?
- RQ2グラフニューラルネットワークは、未学習のハードウェアIPに対して、特定の合成レシピの品質(QoR)をどの程度正確に予測できるか?
- RQ3GCNは、デジタル回路のAIG表現から、どのような構造的および機能的情報を学習できるか?
- RQ4GCNの埋め込みは、ネットリスト構造に基づいて未知のハードウェアIPを分類するために使用可能か?
- RQ5モデルの予測は、多様なハードウェアIP設計に対してどの程度一般化できるか。また、分布シフトのリスクは何か?
主な発見
- GCNモデルはQoR予測タスクにおいて、MSE 0.579 ± 0.02を達成し、他の設定を上回った。
- 予測値と実測値の間に強い相関が認められ、散布図がy=x直線に近く並ぶことから、回帰性能が信頼できることが示された。
- GCN埋め込みを用いたIP分類は35エポックで98.05%の正解率を達成し、モデルがAIGから機能的意味を学習できることを示した。
- t-SNE可視化から、学習済み埋め込みがIPタイプごとにクラスタリングされていることが確認され、モデルが意味のある構造的・機能的パターンを捉えていることが示された。
- ヒューリスティックのゼロコストバージョン(例:rw -z, rf -z)は最適化可能性を効果的に維持し、後続タスクのパフォーマンス向上に寄与した。
- 強力な結果を示したが、f今やiirのような特定のIPではやや性能が低下しており、分布外設計における分布シフトリスクが示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。