Skip to main content
QUICK REVIEW

[論文レビュー] CNN2Gate: Toward Designing a General Framework for Implementation of Convolutional Neural Networks on FPGA

Alireza Ghaffari, Yvon Savaria|arXiv (Cornell University)|Apr 6, 2020
Advanced Neural Network Applications参考文献 30被引用数 10
ひとこと要約

CNN2Gate は、ONNX パースリング、固定小数点量子化、強化学習駆動の設計空間探索を用いて、FPGA 部署用に CNN モデルをコンパイルおよび最適化する自動的で OpenCL 対応のフレームワークである。Intel Arria 10 FPGA 上で AlexNet に対して 18ms、VGG-16 に対して 205ms の推論遅延を達成し、熟練した低レベル設計知識が不要な効率的でスケーラブルかつハードウェアに配慮した FPGA マッピングを実現する。

ABSTRACT

Convolutional Neural Networks (CNNs) have a major impact on our society because of the numerous services they provide. On the other hand, they require considerable computing power. To satisfy these requirements, it is possible to use graphic processing units (GPUs). However, high power consumption and limited external IOs constrain their usability and suitability in industrial and mission-critical scenarios. Recently, the number of researches that utilize FPGAs to implement CNNs are increasing rapidly. This is due to the lower power consumption and easy reconfigurability offered by these platforms. Because of the research efforts put into topics such as architecture, synthesis and optimization, some new challenges are arising to integrate such hardware solutions to high-level machine learning software libraries. This paper introduces an integrated framework (CNN2Gate) that supports compilation of a CNN model for an FPGA target. CNN2Gate exploits the OpenCL synthesis workflow for FPGAs offered by commercial vendors. CNN2Gate is capable of parsing CNN models from several popular high-level machine learning libraries such as Keras, Pytorch, Caffe2 etc. CNN2Gate extracts computation flow of layers, in addition to weights and biases and applies a "given" fixed-point quantization. Furthermore, it writes this information in the proper format for OpenCL synthesis tools that are then used to build and run the project on FPGA. CNN2Gate performs design-space exploration using a reinforcement learning agent and fits the design on different FPGAs with limited logic resources automatically. This paper reports results of automatic synthesis and design-space exploration of AlexNet and VGG-16 on various Intel FPGA platforms. CNN2Gate achieves a latency of 205 ms for VGG-16 and 18 ms for AlexNet on the FPGA.

研究の動機と目的

  • 高水準の CNN モデルを FPGA にマッピングする統合的で自動化されたツールの不足を解消すること。
  • 固定小数点量子化とハードウェアに配慮した最適化を組み合わせることで、リソース制限のある FPGA における効率的で低遅延の推論を実現すること。
  • 自動的設計空間探索とリソース適合を活用して、多様な FPGA プラットフォームへのスケーラブルなデプロイを可能にすること。
  • Keras や PyTorch などの高水準の機械学習フレームワークと FPGA ハードウェアの間のギャップを、統一された OpenCL ベースの合成パイプラインによって埋めること。

提案手法

  • Keras や PyTorch、Caffe2 などの人気フレームワークから抽出されたトレーニング済み CNN モデルを、ONNX 形式を用いてパースし、層の計算フロー、重み、バイアスを抽出する。
  • 事前に定義された固定小数点量子化スキームを適用して、モデルの精度を低下させずハードウェア効率を向上させる。
  • 商用ベンダーツールフロー(例:Intel OpenCL SDK)を用いて、FPGA 合成に適した OpenCL コンパチブルコードを生成する。
  • 強化学習エージェントを用いて自動的設計空間探索を実行し、リソース制約に応じて CNN を異なる FPGA ターゲットにマッピングする。
  • 畳み込み層とプーリング層を統合した単一の処理ユニットにすることで、パイプライン実行を可能にし、スループットを向上させる。
  • ハードウェア構成パrameter(例:CONV ユニット数、バッファサイズ)を用いて、異なる FPGA リソース環境における合成と適合プロセスをガイドする。

実験結果

リサーチクエスチョン

  • RQ1自動化フレームワークは、最小限の手動介入で多様な CNN アーキテクチャを FPGA にマッピングできるか?
  • RQ2強化学習は、CNN の FPGA リソース利用効率と推論遅延の最適化においてどの程度効果的か?
  • RQ3固定小数点量子化は、ハードウェアフットプリントと消費電力の削減を実現しつつ、どの程度モデル精度を維持できるか?
  • RQ4手動最適化された RTL 設計と比較して、自動化された高水準合成パイプラインの遅延およびリソース効率はどの程度か?

主な発見

  • CNN2Gate は、Intel Arria 10 FPGA 上で AlexNet に対して 18ms、VGG-16 に対して 205ms の推論遅延を達成し、自動化による低遅延デプロイを実証した。
  • フレームワークは、より大きな FPGA(例:Arria 10)上で AlexNet と VGG-16 の両方を正常に合成できたが、制御論理のオーバーヘッドのため、小さな Cyclone V FPGA には適合しなかった。
  • 同じ FPGA 上で VGG-16 は AlexNet よりも 8% 多くブロックメモリを必要とした。これは、より深いネットワークアーキテクチャがメモリ使用量に与える影響を示している。
  • CNN2Gate は、[20] の類似設計よりも多くの FPGA リソースを使用したものの、DSP あたり 0.266 GOP/s/DSP の高いパフォーマンス密度を達成し、DSP あたりの効率性が優れていることを示した。
  • VGG-16 において、CNN2Gate は [8] よりも 18% 低い遅延を達成しながらも、DSP をより少ない数で使用した。これは、大規模ネットワークにおける優れた最適化効率を示している。
  • 手動最適化された RTL 設計(例:[10])に比べて、CNN2Gate は原始的なスピードでは劣るが、はるかに優れたスケーラビリティと自動化を提供しており、熟練したハードウェアチューニングの必要性を大幅に低減している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。