Skip to main content
QUICK REVIEW

[論文レビュー] EDD: Efficient Differentiable DNN Architecture and Implementation Co-search for Embedded AI Solutions

Yuhong Li, Cong Hao|arXiv (Cornell University)|May 6, 2020
Advanced Neural Network Applications参考文献 22被引用数 9
ひとこと要約

本論文は、深層ニューラルネットワーク(DNN)アーキテクチャとハードウェア実装を同時に最適化する微分可能で統合的な探索フレームワークEDDを提案する。DNN探索変数とハードウェアパラメータを統一的で微分可能な空間に統合することで、勾配ベースの最適化を可能にし、最先端の性能を達成した:GPUでは1.40倍高速な推論、FPGAでは1.45倍高いスループットを達成した。

ABSTRACT

High quality AI solutions require joint optimization of AI algorithms and their hardware implementations. In this work, we are the first to propose a fully simultaneous, efficient differentiable DNN architecture and implementation co-search (EDD) methodology. We formulate the co-search problem by fusing DNN search variables and hardware implementation variables into one solution space, and maximize both algorithm accuracy and hardware implementation quality. The formulation is differentiable with respect to the fused variables, so that gradient descent algorithm can be applied to greatly reduce the search time. The formulation is also applicable for various devices with different objectives. In the experiments, we demonstrate the effectiveness of our EDD methodology by searching for three representative DNNs, targeting low-latency GPU implementation and FPGA implementations with both recursive and pipelined architectures. Each model produced by EDD achieves similar accuracy as the best existing DNN models searched by neural architecture search (NAS) methods on ImageNet, but with superior performance obtained within 12 GPU-hour searches. Our DNN targeting GPU is 1.40x faster than the state-of-the-art solution reported in Proxyless, and our DNN targeting FPGA delivers 1.45x higher throughput than the state-of-the-art solution reported in DNNBuilder.

研究の動機と目的

  • 探索中にハードウェア実装を固定または推定された要因として扱う、従来のNAS手法におけるギャップを埋める。
  • 多様なプラットフォームにおいて、DNNの精度とハードウェアパフォーマンス(遅延、スループット、エネルギー)を同時に最適化することを可能にする。
  • DNNアーキテクチャと実装変数を1つの探索空間に統合する、統一的で微分可能な定式化を開発する。
  • 最小限の探索コストで、低遅延GPUおよびFPGAアクセラレータをターゲットとする高性能なAIソリューションを達成する。
  • GPU、再帰的FPGA、パイプラインFPGAアーキテクチャを含む、さまざまなハードウェアプラットフォームへの一般化を実証する。

提案手法

  • DNNアーキテクチャ変数(例:フィルターサイズ、チャネル拡張)とハードウェア実装変数(例:精度、タイリング、パイプライン化)を1つの統一された解空間に統合して、共同探索問題を定式化する。
  • DNNの精度(交差エントロピー損失を介して)とハードウェアパフォーマンス(遅延/スループット損失を介して)を同時に最適化する複合的目的関数を定義し、微分可能成分を含む。
  • Gumbel-Softmaxや微分可能なアーキテクチャ重みなどの微分可能演算を用いて、統合された探索空間における勾配ベース最適化を可能にする。
  • 確率的勾配降下法(SGD)を用いて、DNNアーキテクチャと実装パラメータを同時に更新し、効率的でエンドツーエンドの学習を実現する。
  • 4-, 8-, 16-, 32ビットなどの複数の精度フォーマットと、ハードウェア固有の最適化(例:カーネル統合、ループタイリング、リソース共有)を、微分可能フレームワーク内に統合する。
  • 3つのプラットフォーム(低遅延GPU、再帰的FPGA、パイプラインFPGA)で手法を検証し、12 GPU時間未満で探索を実施した。

実験結果

リサーチクエスチョン

  • RQ1完全に微分可能な統合的探索フレームワークは、DNNアーキテクチャとハードウェア実装を同時に最適化し、精度とパフォーマンスの向上を達成できるか?
  • RQ2DNNアーキテクチャとハードウェア実装を共同で探索することは、分離されたNASと実装ワークフローと比較して、推論遅延とスループットにどのような影響を及けるか?
  • RQ3本手法の微分可能定式化は、GPUやFPGAなど、異なるアーキテクチャ的制約を持つ多様なハードウェアプラットフォームに、どの程度一般化可能か?
  • RQ4本手法は、最先端のNASモデルと同等の精度を達成しつつ、ハードウェア効率性において顕著に優れたDNNを発見できるか?
  • RQ5探索空間にハードウェアに配慮した制約(例:精度、リソース共有、パイプライン化)を組み込むと、最終的なモデルのパフォーマンスと効率性にどのような影響を与えるか?

主な発見

  • GPUをターゲットとするEDD-Net-1は、Titan RTXで11.17 msの推論遅延を達成し、Proxyless-GPUモデルよりも1.40倍高速であった。
  • 1080 Ti GPUでは、EDD-Net-1はMNasNetよりも1.6倍、FBNet-Cよりも2.0倍の遅延削減を実現しながら、高い精度を維持した。
  • 再帰的FPGAアクセラレータをターゲットとするEDD-Net-2は、Xilinx ZCU102で7.96 msの遅延を達成し、ProxylessNet(1.37倍速)、FBNet(1.53倍速)、MNasNet(1.1倍速)を上回った。
  • ZC706で900個のDSPを搭載するパイプラインFPGAアクセラレータをターゲットとするEDD-Net-3は、16ビット固定小数点精度下でDNNBuilderベースライン比1.45倍の高いスループットを達成した。
  • すべてのEDDモデルは、最先端のNASモデルと同等のImageNet top-1精度を達成しながら、顕著に高いハードウェア効率性を示した。
  • 全共同探索プロセスは12 GPU時間未満で完了し、従来のNASおよび実装ワークフローと比較して高い効率性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。