[論文レビュー] FANN-on-MCU: An Open-Source Toolkit for Energy-Efficient Neural Network Inference at the Edge of the Internet of Things
FANN-on-MCU は、ARM Cortex-M および RISC-V PULP プラットフォームを対象とした、超低消費電力マイコン(MCU)上でエネルギー効率の高いニューラルネットワーク推論を可能にするオープンソースのツールキットである。訓練済みの FANN モデルを MCU 向けに最適化された C コードにコンパイルし、オクタコア RISC-V プラットフォームでは単一コアの ARM Cortex-M4 実装と比較して最大 22 倍の高速化と 69% のエネルギー削減を達成した。推論遅延はマイクロ秒オーダー、消費電力は 1 mW 未満で実現した。
The growing number of low-power smart devices in the Internet of Things is coupled with the concept of "Edge Computing", that is moving some of the intelligence, especially machine learning, towards the edge of the network. Enabling machine learning algorithms to run on resource-constrained hardware, typically on low-power smart devices, is challenging in terms of hardware (optimized and energy-efficient integrated circuits), algorithmic and firmware implementations. This paper presents FANN-on-MCU, an open-source toolkit built upon the Fast Artificial Neural Network (FANN) library to run lightweight and energy-efficient neural networks on microcontrollers based on both the ARM Cortex-M series and the novel RISC-V-based Parallel Ultra-Low-Power (PULP) platform. The toolkit takes multi-layer perceptrons trained with FANN and generates code targeted at execution on low-power microcontrollers either with a floating-point unit (i.e., ARM Cortex-M4F and M7F) or without (i.e., ARM Cortex M0-M3 or PULP-based processors). This paper also provides an architectural performance evaluation of neural networks on the most popular ARM Cortex-M family and the parallel RISC-V processor called Mr. Wolf. The evaluation includes experimental results for three different applications using a self-sustainable wearable multi-sensor bracelet. Experimental results show a measured latency in the order of only a few microseconds and a power consumption of few milliwatts while keeping the memory requirements below the limitations of the targeted microcontrollers. In particular, the parallel implementation on the octa-core RISC-V platform reaches a speedup of 22x and a 69% reduction in energy consumption with respect to a single-core implementation on Cortex-M4 for continuous real-time classification.
研究の動機と目的
- リソース制限があり、バッテリ駆動の IoT デバイスに適した、計算能力およびメモリリソースが限られた環境において、エネルギー効率の高いニューラルネットワークを実装する課題に対処すること。
- ARM Cortex-M および RISC-V ベースの PULP プラットフォームを含む、低消費電力マイコン上でマルチレイヤーパーセプトロンの効率的推論を可能にすること。
- マルチコアの超低消費電力アーキテクチャにおける並列処理の高速化、エネルギー消費、メモリオーバーヘッドのトレードオフを分析すること。
- 訓練済みの FANN モデルと組み合わせて、組み込み MCU で効率的かつリアルタイムの推論を実現する実用的でオープンソースのソフトウェアスタックを提供すること。
- 最適化されたファームウェare とハードウェアに最適化されたコンパイル技術を用いることで、エッジデバイスで複雑なニューラルネットワークを最小限のエネルギーと遅延で実行できるかを実証すること。
提案手法
- ツールキットは、FANN ライブラリの訓練済みマルチレイヤーパーセプトロンモデルを、マイコン実行に最適化された手動最適化 C コードにコンパイルする。
- 32 ビット ARM Cortex-M4 および 32 ビット RISC-V RI5CY コアをサポートしており、浮動小数点ユニットを搭載している・いない両方のバリアントに対応する。
- PULP プラットフォームの複数コア上で並列推論戦略を実装し、タスクの分散とメモリアクセスを管理してオーバーヘッドを最小限に抑える。
- 固定小数点量子化、ループアンローリング、メモリアクセスの削減などの最適化により、エネルギーと遅延を最小限に抑える。
- 実ハードウェア上でエンドツーエンドのプロファイリングにより、nRF52832 および Mr. Wolf(PULP)プラットフォームを含む、実測のパワーメジャーメントと実行時間測定を実施した。
- 自立型のウェアラブルマルチセンサーブracelet を用いて、3 つの実世界の応用事例を評価し、エネルギー効率とリアルタイム性能を検証した。
実験結果
リサーチクエスチョン
- RQ1リソース制限があり、メモリと処理能力が限られた超低消費電力マイコン上で、軽量なニューラルネットワークフレームワークを効率的にコンパイル・実行する方法は何か?
- RQ2ニューラルネットワーク推論において、マルチコア RISC-V プラットフォームの並列実行と単一コアの ARM Cortex-M4 との間で、パフォーマンスとエネルギーのトレードオフはどのように変化するか?
- RQ3FANN-on-MCU は、組み込み MCU でモデルの正確性を維持したまま、推論遅延とエネルギー消費をどの程度低減できるか?
- RQ4マルチコア組み込みシステムにおいて、並列化のオーバーヘッドとメモリ転送が、スループットとエネルギー効率にどのように影響を与えるか?
- RQ5このフレームワークは、極めて低い電力消費で運用するバッテリ駆動のウェアラブルデバイスで、リアルタイムかつ継続的な分類タスクをサポートできるか?
主な発見
- オクタコア RISC-V PULP プラットフォームにおける並列実装により、連続的なリアルタイム分類において、単一コアの ARM Cortex-M4 実装と比較して 22 倍の高速化と 69% のエネルギー削減を達成した。
- nRF52832(ARM Cortex-M4)では推論が 17.6 ms、エネルギー消費が 183.74 µJ で完了したが、同様のタスクを Mr. Wolf(8 コア RISC-V)で実行した場合、0.8 ms で完了し、エネルギー消費は 49.43 µJ にまで低下し、14 倍の高速化と 73% のエネルギー削減を達成した。
- 小さなネットワークに対しては、RISC-V マルチコア実装が ARM Cortex-M4 ベースラインと比較して 13.33 倍の高速化と 85.15% のエネルギー削減を達成した。
- すべての評価済みアプリケーションで、ミリ秒未満の推論遅延(最短 0.004 ms)と 10 mW 未満の消費電力が達成され、メモリ使用量も MCU の制約内に収まった。
- PULP 上の並列アプローチでは、単一コアと比較して最大 7.1 倍の高速化が得られたが、コア数の増加に伴い消費電力も上昇したため、動的コア起動戦略の導入が不可欠であることが示された。
- このツールキットは、最大 103,800 回の MAC 演算を含む複雑なニューラルネットワークが、極めて低いエネルギーと遅延で超低消費電力 MCU で効率的に実行可能であることを実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。