Skip to main content
QUICK REVIEW

[論文レビュー] A General Neural Network Hardware Architecture on FPGA

Yufeng Hao|arXiv (Cornell University)|Nov 6, 2017
Neural Networks and Applications参考文献 5被引用数 11
ひとこと要約

本論文では、Xilinx ZU9CG FPGA SoC 上に実装された汎用的なニューラルネットワークハードウェアアーキテクチャを提案する。この設計により、カスタマイズ可能な大規模並列処理を活用し、深層ニューラルネットワークの高パフォーマンスな推論および学習が可能になる。アーキテクチャはネットワークの種別やスケールに応じて動的に調整可能であり、前向き伝搬と逆伝搬の効率的実行がリソースの最適利用とともに実現される。

ABSTRACT

Field Programmable Gate Arrays (FPGAs) plays an increasingly important role in data sampling and processing industries due to its highly parallel architecture, low power consumption, and flexibility in custom algorithms. Especially, in the artificial intelligence field, for training and implement the neural networks and machine learning algorithms, high energy efficiency hardware implement and massively parallel computing capacity are heavily demanded. Therefore, many global companies have applied FPGAs into AI and Machine learning fields such as autonomous driving and Automatic Spoken Language Recognition (Baidu) [1] [2] and Bing search (Microsoft) [3]. Considering the FPGAs great potential in these fields, we tend to implement a general neural network hardware architecture on XILINX ZU9CG System On Chip (SOC) platform [4], which contains abundant hardware resource and powerful processing capacity. The general neural network architecture on the FPGA SOC platform can perform forward and backward algorithms in deep neural networks (DNN) with high performance and easily be adjusted according to the type and scale of the neural networks.

研究の動機と目的

  • FPGA上で多様なDNNの種別とサイズをサポートする再構成可能なニューラルネットワークハードウェアアーキテクチャを設計すること。
  • FPGAの並列処理性と低消費電力特性を活用し、効率的なディープラーニングワークロードを実現すること。
  • FPGA SoC 上で高スループットかつ低遅延な前向き伝搬および逆伝搬アルゴリズムを実装すること。
  • パrameterの再設定により、さまざまなニューラルネットワークアーキテクチャへの容易な適合を可能にすること。
  • FPGAをスケーラブルでエネルギー効率の良いAIおよび機械学習アプリケーションのプラットフォームとして使用する可能性を実証すること。

提案手法

  • アーキテクチャは、豊富なDSPおよびBRAMリソースを活用するXilinx ZU9CGシステムオンチップ(SoC)に実装されている。
  • 全結合層および畳み込み層における行列乗算と活性化関数処理を効率的に行うパイプライン化された並列処理フレームワークが設計されている。
  • 前向き伝搬モードと逆伝搬モードの間で動的に切り替えられる仕組みにより、推論と学習の両方をサポートしている。
  • カスタマイズ可能なパrameterインターフェースにより、ネットワークの深さ、幅、層の種別を実行時において調整可能である。
  • データフロー効率を最適化するためのハードウェアモジュールが設計されており、メモリアクセスの遅延を最小限に抑え、スループットを最大化している。
  • 処理ユニットと外部メモリ間の通信にはAXIインターフェースが使用されており、高帯域幅のデータ転送を実現している。

実験結果

リサーチクエスチョン

  • RQ1多様なDNNワークロードに対応するため、一般用途のニューラルネットワークハードウェアアーキテクチャをFPGA SoCに効率的にマッピングする方法は何か?
  • RQ2FPGAベースのDNNアクセラレータにおいて、高パフォーマンスと低消費電力の両立を実現するアーキテクチャ的選択とは何か?
  • RQ3同じハードウェアフレームワークが、最小限の再構成で推論と学習の両方をサポートできるか?
  • RQ4提案アーキテクチャは、ネットワークサイズや種別が変化する際にどのようにスケーリングするか?
  • RQ5Xilinx ZU9CGのような最新のFPGAプラットフォーム上での実現可能なスループットとリソース利用効率はどの程度か?

主な発見

  • 提案アーキテクチャは、Xilinx ZU9CG FPGA SoC 上で深層ニューラルネットワークの前向き伝搬および逆伝搬を効果的にサポートしている。
  • 全結合層および畳み込み層を含む、さまざまなネットワークアーキテクチャへの動的再構成が可能である。
  • 行列演算および活性化関数のパイプライン化された並列処理により、高い計算スループットが達成された。
  • DSPスライスおよびブロックRAMを活用した低遅延計算により、リソースの効率的利用が実現された。
  • さまざまなDNNのサイズと種別にわたるスケーラブルな展開が可能であり、一般用途としての適用可能性が確認された。
  • 高いエネルギー効率性を示しており、自動運転や音声認識などのリアルタイムAIアプリケーションに適している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。