Skip to main content
QUICK REVIEW

[論文レビュー] A Fast Network Exploration Strategy to Profile Low Energy Consumption for Keyword Spotting

Arnab Neelim Mazumder, Tinoosh Mohsenin|arXiv (Cornell University)|Feb 4, 2022
Speech and Audio Processing被引用数 7
ひとこと要約

本稿では、FPGA上でキーワード検出(KWS)に適したエネルギー効率が良く、量子化され、スケーリングされた深層ニューラルネットワーク(DNN)構成を素早く特定するための回帰ベースのネットワーク探索戦略を提案する。フィルタースケーリング(s)と量子化(q)の両方を変化させた際のエネルギー消費量と精度を多項式回帰でモデル化することで、高速なハードウェアに最適化された設計空間探索が可能となり、Xilinx AC701プラットフォーム上では、先行するFPGAベースのKWSアクセラレーターよりも2.1倍低いエネルギー消費量と4倍高いエネルギー効率を達成した。

ABSTRACT

Keyword Spotting nowadays is an integral part of speech-oriented user interaction targeted for smart devices. To this extent, neural networks are extensively used for their flexibility and high accuracy. However, coming up with a suitable configuration for both accuracy requirements and hardware deployment is a challenge. We propose a regression-based network exploration technique that considers the scaling of the network filters ($s$) and quantization ($q$) of the network layers, leading to a friendly and energy-efficient configuration for FPGA hardware implementation. We experiment with different combinations of $\mathcal{NN}\scriptstyle\langle q,\,s angle \displaystyle$ on the FPGA to profile the energy consumption of the deployed network so that the user can choose the most energy-efficient network configuration promptly. Our accelerator design is deployed on the Xilinx AC 701 platform and has at least 2.1$ imes$ and 4$ imes$ improvements on energy and energy efficiency results, respectively, compared to recent hardware implementations for keyword spotting.

研究の動機と目的

  • リソース制限のあるFPGA上で低消費電力で高精度なKWSを実現するための最適なDNNハイパーパrameter(フィルタースケーリングsと量子化q)の選択という課題に対処すること。
  • 全探索に代わる回帰モデルを用いることで、ハードウェアデプロイ用のDNN構成探索に要する時間と計算コストを削減すること。
  • リアルタイムKWSを低コストFPGA上で実現するために、精度要件を満たすエネルギー効率の良いネットワーク構成を素早く同定できること。
  • 複数の処理要素と精度レベルをサポートするスケーラブルかつパラメータ化されたアクセラレータアーキテクチャの開発

提案手法

  • 量子化(q)とフィルタースケーリング(s)パラメータを変数として、エネルギー消費量と精度を関数としてモデル化する回帰ベースのネットワーク探索フレームワークを構築した。
  • 実験データを用いて12のDNN構成(小規模なセット)から二つの多項式回帰モデルを学習させ、未学習の(q,s)組み合わせにおける精度とエネルギー消費量を予測した。
  • Xilinx AC701 FPGA上でのDNNエネルギー消費量のプロファイリングに、体系的かつ実験的・分析的な手法を適用し、MFCCベースのKWSワークロードに焦点を当てた。
  • さまざまな(q,s)構成をサポートするパラメータ化・スケーラブルなハードウェアアクセラレータを設計し、出力チャネルのタイリングによりPEの利用効率と性能を最大化した。
  • 全再訓練や各候補構成ごとのハードウェア合成を繰り返さずに、最適な構成の素早い選定が可能になった。
  • 回帰予測値と実測値の比較により、本手法の妥当性を検証した。未学習の(q,s)構成においても高い予測精度が得られた。

実験結果

リサーチクエスチョン

  • RQ1FPGA上でのDNNベースのKWSにおいて、フィルタースケーリング(s)と量子化(q)を変化させた場合、エネルギー消費量と精度にどのような影響を与えるか?
  • RQ2完全なハードウェア合成を伴わずに、多項式回帰モデルが異なる(q,s)構成におけるDNNのエネルギー消費量と精度を正確に予測できるか?
  • RQ3本手法は、全探索やNASと比較して、DNN構成探索に要する時間とコストをどのように削減できるか?
  • RQ4本手法を用いたハードウェアに最適化された探索戦略により、低コストFPGA上でのKWSにおけるエネルギー効率と精度のトレードオフはどの程度達成可能か?
  • RQ5本回帰モデルは、異なるFPGAプラットフォームや精度レベルに対応するアクセラレータ設計をガイドするための汎用性を持つだろうか?

主な発見

  • 回帰モデルは高い予測精度を達成し、未学習の(q,s)構成におけるエネルギーと精度の予測値が実測値と非常に近い結果となった。
  • 提案されたアクセラレータは、同じXC7A200T FPGA上で評価されたDinelliら(2019年)の最近の研究と比較して、2.1倍低いエネルギー消費量と4倍高いエネルギー効率を達成した。
  • 100 MHzのクロック周波数で、Zhangら(2017年)のマイコンベース実装よりも8.5倍高速でありながら、エネルギー消費量も少なかった。
  • モデルサイズはわずか340 KBであり、低コストマイコンやエッジデバイスへのデプロイに適していた。
  • 全設計空間プロファイリングに必要なDNNトレーニング実行回数をわずか12回にまで削減でき、迅速な探索が可能になった。
  • 4ビット量子化と4.5倍のフィルタースケーリング条件下で、90.1%の精度を達成し、エネルギー消費量は0.58 mJであった。これは、先行するFPGAベースのKWSシステムを上回る性能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。