Skip to main content
QUICK REVIEW

[論文レビュー] DNNFuser: Generative Pre-Trained Transformer as a Generalized Mapper for Layer Fusion in DNN Accelerators

Sheng-Chun Kao, Xiaoyu Huang|arXiv (Cornell University)|Jan 26, 2022
Advanced Data Storage Technologies被引用数 5
ひとこと要約

DNNFuser は、事前学習済みのトランスフォーマーを用いたワンショットで推論に基づくマッパーを提案し、DNNアクセラレータにおけるレイヤーフュージョン最適化を自動化する。これは、探索ベースの手法と同等の性能を達成しながら、66倍〜127倍の高速化を実現する。また、未確認のハードウェア条件にも一般化可能であり、最小限の微調整で新しいDNNワークロードにおける効率的な転移学習を可能にする。

ABSTRACT

Dataflow/mapping decides the compute and energy efficiency of DNN accelerators. Many mappers have been proposed to tackle the intra-layer map-space. However, mappers for inter-layer map-space (aka layer-fusion map-space), have been rarely discussed. In this work, we propose a mapper, DNNFuser, specifically focusing on this layer-fusion map-space. While existing SOTA DNN mapping explorations rely on search-based mappers, this is the first work, to the best of our knowledge, to propose a one-shot inference-based mapper. We leverage Transformer as our DNN architecture to learn layer-fusion optimization as a sequence modeling problem. Further, the trained DNNFuser can generalize its knowledge and infer new solutions for unseen conditions. Within one inference pass, DNNFuser can infer solutions with compatible performance to the ones found by a highly optimized search-based mapper while being 66x-127x faster.

研究の動機と目的

  • DNNアクセラレータ最適化における、ほとんど未開拓とされる「レイヤー間マップスペース(レイヤーフュージョン)」の自動マッパーの欠如に対処する。
  • 遺伝的アルゴリズムや強化学習などの既存の探索ベースマッパーが、最適なマッピングを求めるために膨大な探索を要するという、高い計算コストを克服する。
  • 反復的探索を必要とせず、1回の推論で最適なレイヤーフュージョン戦略を即座に生成する、高速でワンショットの推論ベースのマッピングを実現し、デプロイ効率を向上させる。
  • 未確認のハードウェア条件(例:オンチップバッファサイズの変動)への一般化および、多様なDNNワークロード間での転移学習を実証する。
  • トランスフォーマーを用いたシーケンスモデリング問題としてレイヤーフュージョンを定式化することで、DNNマッパー設計の新しいパラダイムを確立する。

提案手法

  • レイヤーフュージョンマッピングを、入力がDNNモデルのレイヤー構成とハードウェア制約、出力が統合されたレイヤー構成である、シーケンス・ツー・シーケンス(seq2seq)問題として定式化する。
  • 入力のDNNおよびハードウェア条件から最適なレイヤーフュージョンパターンへのマッピングを学習する、事前学習済みのトランスフォーマー・アーキテクチャを用いる。
  • 多様なDNNワークロード(例:VGG16、ResNet18)でモデルを学習させ、効率的なレイヤーフュージョンの一般化された知識を習得する。
  • 推論ベースのデプロイを可能にする:訓練が終了すれば、1回のフォワードパスで解決策を生成し、探索の必要がなくなる。
  • 新しいDNNワークロード(例:ResNet50、MobileNet-V2)に適用する際、事前学習済みDNNFuserを微調整することで転移学習を実現し、学習エポック数の10%程度で十分な性能を達成する。
  • オンチップバッファサイズを条件としてモデルに与えることで、実行時のハードウェア制約に動的に適応可能にする。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みのトランスフォーマー・モデルは、多様なDNNワークロードおよびハードウェア条件において、効果的にレイヤーフュージョン戦略を学習・一般化できるか?
  • RQ2ワンショット推論ベースマッパー(DNNFuser)の性能は、最先端の探索ベースマッパーと比較して、解の質と速度の両面で優れているか?
  • RQ3DNNFuserは、オンチップバッファサイズの変動といった、未確認のハードウェア構成に対し、どの程度一般化できるか?
  • RQ4転移学習により、新しいDNNモデルにDNNFuserを適用する際、学習時間を顕著に短縮でき、性能向上も達成できるか?
  • RQ5より長いシーケンス(例:ResNet18のような深層ネットワーク)において、トランスフォーマーに基づくアプローチは、RNNベースのモデル(例:Seq2Seq)を上回る性能を示すか?

主な発見

  • DNNFuser は、最先端の探索ベースマッパーと同等の性能を維持しながら、推論時間でのマッピングを66倍〜127倍高速化した。
  • ResNet18 では、トランスフォーマーが長いシーケンスをより効果的に処理できるため、RNNベースのSeq2Seqベースラインを上回った。これは、トランスフォーマーがシーケンスモデリングにおいて優位であることを示している。
  • DNNFuser は、再トレーニングなしで、未確認のオンチップバッファサイズに対しても、妥当かつ効率的なマッピングを生成でき、一般化性能を示した。
  • 転移学習により、新しいDNNワークロード(例:ResNet50、MobileNet-V2)に適用する際、学習を完全から再開する場合に比べて10%のエポック数で十分な性能が得られ、性能は同等またはそれ以上であった。
  • 事前学習済みの汎用マッパーは、VGG16ではG-Samplerと同等の性能を達成し、ResNet18ではそれを上回った。これにより、多様なアーキテクチャにわたる有効性が裏付けられた。
  • モデルは、活性化サイズが小さいため、より深いレイヤーを積極的に統合するよう学習した。また、活性化の形状やチャネル数の増加に伴いメモリ圧力が高まるにつれ、オフチップ同期を実行するよう学習した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。