Skip to main content
QUICK REVIEW

[論文レビュー] FFT-Based Deep Learning Deployment in Embedded Systems

Sheng Lin, Ning Liu|arXiv (Cornell University)|Dec 13, 2017
Advanced Neural Network Applications参考文献 25被引用数 4
ひとこと要約

この論文は、高速フーリエ変換(FFT)に基づく重み行列を用いることで、計算量とストレージの複雑さを低減する、組み込みシステム向けのFFTベースの深層ニューラルネットワーク(DNN)フレームワークを提案している。この手法により、最小限の精度損失で高速な推論が実現され、ARMベースのモバイルプラットフォームへの効率的なデプロイが可能である。C++ではJavaよりも最大130%高速な推論を達成し、MNISTではIBM TrueNorthですらも上回る速度を示した。

ABSTRACT

Deep learning has delivered its powerfulness in many application domains, especially in image and speech recognition. As the backbone of deep learning, deep neural networks (DNNs) consist of multiple layers of various types with hundreds to thousands of neurons. Embedded platforms are now becoming essential for deep learning deployment due to their portability, versatility, and energy efficiency. The large model size of DNNs, while providing excellent accuracy, also burdens the embedded platforms with intensive computation and storage. Researchers have investigated on reducing DNN model size with negligible accuracy loss. This work proposes a Fast Fourier Transform (FFT)-based DNN training and inference model suitable for embedded platforms with reduced asymptotic complexity of both computation and storage, making our approach distinguished from existing approaches. We develop the training and inference algorithms based on FFT as the computing kernel and deploy the FFT-based inference model on embedded platforms achieving extraordinary processing speed.

研究の動機と目的

  • リソース制限のある組み込みシステム(メモリと計算能力が限られている)に、大規模で高精度なDNNモデルを効果的にデプロイする課題に対処すること。
  • 顕著な精度低下を伴わずに、DNNにおける計算複雑度とモデルストレージ要件の両方を低減すること。
  • モバイルおよび組み込みプラットフォームでの効率的な学習と推論を可能にする、画期的なFFTベースのDNNフレームワークを開発すること。
  • IBM TrueNorthのような従来のASICベースのソリューションと比較して、ARMベースの組み込みシステムにおける推論性能を優れていることを実証すること。

提案手法

  • この手法は、学習および推論の両方のコア計算キーナルとして高速フーリエ変換(FFT)を採用し、標準的な密行列演算を置き換える。
  • 全結合層および畳み込み層の重み行列は、FFTの効率を活かすために巡回行列またはブロック巡回行列として構造化される。
  • フレームワークはFFTベースの行列乗算を用い、計算およびストレージの漸近的複雑度をO(n²)からO(n log n)に低減する。
  • 巡回構造を用いることで、大規模な重み行列を少数のパラメータで表現するモデル圧縮が可能となり、パラメータ数を最大n分の1に削減できる。
  • バックプロパゲーションをFFTベースの計算に適応させたエンドツーエンドの学習が行われ、微調整により精度を保持する。
  • 推論は、OpenCVを用いた画像処理を伴うC++およびJava実装を用いて、ARMベースのモバイルプラットフォームにデプロイされる。

実験結果

リサーチクエスチョン

  • RQ1FFTベースの重み行列表現は、組み込みシステムにおけるDNNの計算量およびストレージ複雑度を顕著に低減できるか?
  • RQ2IBM TrueNorthのような既存の組み込みおよびASICベースのソリューションと比較して、FFTベースのDNNフレームワークの推論速度と精度はどのように異なるか?
  • RQ3巡回行列によるモデル圧縮は、パラメータ数の削減と併せ、分類精度をどの程度維持できるか?
  • RQ4モバイルプラットフォームにおけるC++およびJava実装の間で、FFTベースの推論にどのようなパフォーマンス差が生じるか?

主な発見

  • FFTベースのDNNフレームワークは、巡回行列構造とFFT演算を活用することで、モデルストレージ要件と計算複雑度を低減した。
  • MNISTデータセットにおいて、本フレームワークは、わずかな精度低下の後で、IBM TrueNorthよりも10倍速い推論速度を達成した。
  • CIFAR-10では、C++実装が1画像あたり8,912 μsの推論時間を記録し、Java実装(21,032 μs)よりも130%高速であった。
  • Honor 6XデバイスにおけるC++実装は、1画像あたり8,244 μsの推論時間を達成し、Javaバージョン(19,785 μs)を著しく上回った。
  • IBM TrueNorthに比べて500〜1,000倍少ないコア数を用いながらも、CIFAR-10で80.2%の精度を達成し、競争力のあるパフォーマンスを示した。
  • C++とJava実装の間のパフォーマンス格差は、Androidにおけるメモリ管理制約とデータ型変換のオーバーヘッドに起因している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。