Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Co-design of Neural Architectures and Hardware Accelerators

Yanqi Zhou, Xuanyi Dong|arXiv (Cornell University)|Feb 17, 2021
Advanced Neural Network Applications参考文献 37被引用数 17
ひとこと要約

本論文は、産業標準のエッジアクセラレータ上で、モデルアーキテクチャとアクセラレータ設定を共同最適化する、NAHASと呼ばれる統合的ニューラルアーキテクチャおよびハードウェアアクセラレータ探索フレームワークを提案する。ハードウェア制約を考慮した両者の共同探索により、最先端の手法と比較して、ImageNetのトップ-1精度が1%向上し、最大2倍のエネルギー消費削減を達成した。

ABSTRACT

Neural architectures and hardware accelerators have been two driving forces for the progress in deep learning. Previous works typically attempt to optimize hardware given a fixed model architecture or model architecture given fixed hardware. And the dominant hardware architecture explored in this prior work is FPGAs. In our work, we target the optimization of hardware and software configurations on an industry-standard edge accelerator. We systematically study the importance and strategies of co-designing neural architectures and hardware accelerators. We make three observations: 1) the software search space has to be customized to fully leverage the targeted hardware architecture, 2) the search for the model architecture and hardware architecture should be done jointly to achieve the best of both worlds, and 3) different use cases lead to very different search outcomes. Our experiments show that the joint search method consistently outperforms previous platform-aware neural architecture search, manually crafted models, and the state-of-the-art EfficientNet on all latency targets by around 1% on ImageNet top-1 accuracy. Our method can reduce energy consumption of an edge accelerator by up to 2x under the same accuracy constraint, when co-adapting the model architecture and hardware accelerator configurations.

研究の動機と目的

  • ハードウェア設定を固定するプラットフォームに配慮したNASの制限を解消し、モデル効率性とパフォーマンスを向上させること。
  • エッジデバイスにおけるハードウェアアクセラレータ設定がニューラルアーキテクチャ探索の結果とモデル効率性に与える影響を調査すること。
  • 遅延、エネルギー、チップ面積の制約下で、ニューラルアーキテクチャとハードウェアアクセラレータ設定を統合的に最適化するフレームワークを開発すること。
  • NASの探索空間をカスタマイズし、両空間を共同で探索することで、逐次的または固定設定のアプローチよりも優れたパレート最適解が得られることを示すこと。
  • 実際のエッジアクセラレータを用いて、画像分類やセマンティックセグメンテーションなどの異なるタスクにわたり、フレームワークの一般化能力を検証すること。

提案手法

  • ニューラルアーキテクチャとハードウェアアクセラレータ設定を統合された探索空間内で同時に探索する二段階最適化フレームワークであるNAHASを提案する。
  • ニューラルアーキテクチャとハードウェアアクセラレータ設定(例:処理要素数、メモリ帯域幅、計算対メモリ比)をすべて調整可能なパラメータとして定式化する。
  • 実用的妥当性を確保するため、チップ面積、推論遅延、エネルギー消費量のハードウェアリソース制約を課す。
  • 固定モデルではなく、実世界のワークロード(例:画像分類、オブジェクト検出)に従って探索が誘導されるタスク指向のアプローチを採用する。
  • 大規模な探索空間をスケーラブルに探索可能にするために、パラメータ共有を活用したマルチトライアル探索戦略を採用する。
  • ハードウェアとモデルの共同最適化中に、探索と制約満たしのバランスを取るために、ソフト制約関数とハード制約関数を適用する。

実験結果

リサーチクエスチョン

  • RQ1ハードウェア設定を固定することで、プラットフォームに配慮したニューラルアーキテクチャ探索のパフォーマンスと効率性にどのような制限が生じるか?
  • RQ2エッジアクセラレータ上で、ニューラルアーキテクチャとハードウェアアクセラレータ設定を共同最適化することで、精度、遅延、エネルギー効率がどの程度向上するか?
  • RQ3異なるユースケース(例:小規模 vs. 大規模モデル、異なるタスク)が、最適なハードウェアおよびモデル設定にどのように影響を与えるか?
  • RQ4ニューラルアーキテクチャとハードウェアパラメータを統合した統一探索空間は、逐次的または独立した最適化と比較して、より優れたパレート最適解をもたらすか?
  • RQ5NAS探索戦略の選択(例:oneshot対 multi-trial)が、遅延およびエネルギー制約が変化する条件下でパフォーマンスとスケーラビリティに与える影響はいかほどか?

主な発見

  • NAHASは、すべての遅延ターゲットにおいて、EfficientNetを含む最先端のモデルと比較して、ImageNetトップ-1精度が1%向上した。
  • NAHASは、同じ精度を維持しながら、ベースラインアクセラレータと比較して最大2倍のエネルギー消費を削減し、顕著な効率向上を示した。
  • 共同探索は、逐次的または固定設定のアプローチを常に上回り、フェーズベースの探索手法ですら、探索予算を2倍にした場合でも劣るパフォーマンスを示した。
  • 最適なハードウェア設定はモデルサイズやタスクに大きく依存する:小規模モデルは多数のPEと少ないメモリを必要とし、大規模モデルはより大きなローカルメモリとレジスタファイルが有利である。
  • squeeze-and-exciteやSwish非線形関数のような計算コストの高い演算を削除することで、推論遅延とエネルギー効率が向上したが、精度に悪影響を与えることなく実現された。
  • タイトな遅延制約を有する小規模モデルでは、oneshot NASがmulti-trial NASよりも効果的であるが、大規模モデルではスーパーネット構築コストのため実用的でない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。