Skip to main content
QUICK REVIEW

[論文レビュー] RTMobile: Beyond Real-Time Mobile Acceleration of RNNs for Speech Recognition

Peiyan Dong, Siyue Wang|arXiv (Cornell University)|Feb 19, 2020
Advanced Neural Network Applications参考文献 35被引用数 12
ひとこと要約

RTMobile は、ブロックベース構造的 pruning(BSP)とコンパイラ最適化を組み合わせることで、モバイルデバイス上でリアルタイム RNN 推論を達成する最初のフレームワークである。モデル圧縮率が 10 倍以上で精度の損失なしに実現され、従来の FPGA ベース手法に比べてエネルギー効率が 40 倍向上し、精度・速度・効率の面で最先端の手法を上回る性能を発揮する。

ABSTRACT

Recurrent neural networks (RNNs) based automatic speech recognition has nowadays become prevalent on mobile devices such as smart phones. However, previous RNN compression techniques either suffer from hardware performance overhead due to irregularity or significant accuracy loss due to the preserved regularity for hardware friendliness. In this work, we propose RTMobile that leverages both a novel block-based pruning approach and compiler optimizations to accelerate RNN inference on mobile devices. Our proposed RTMobile is the first work that can achieve real-time RNN inference on mobile platforms. Experimental results demonstrate that RTMobile can significantly outperform existing RNN hardware acceleration methods in terms of inference accuracy and time. Compared with prior work on FPGA, RTMobile using Adreno 640 embedded GPU on GRU can improve the energy-efficiency by about 40$ imes$ while maintaining the same inference time.

研究の動機と目的

  • 高い計算複雑性とメモリ消費量のため、モバイルデバイス上でリアルタイム RNN 推論を達成する課題に対処すること。
  • 既存の RNN 加速技術におけるモデル圧縮、推論精度、ハードウェア効率のトレードオフを克服すること。
  • モバイルプラットフォームにおける RNN に対して、高い精度と高い計算効率を両立するエンドツーエンドのフレームワークを開発すること。
  • TVM らような既存の DNN 加速フレームワークが RNN をサポートしていないという制限を解消すること。
  • 専用ハードウェア(FPGA など)に依存せずに、モバイル GPU や CPU でリアルタイム性能を達成しつつ、高いエネルギー効率とモデル精度を維持すること。

提案手法

  • ハードウェア効率を確保するためのモデルの規則性を保ちつつ、細粒度の pruning を可能にする新しいブロックベース構造的 pruning(BSP)アルゴリズムを提案する。
  • 行列の再順序付け、不要なロードの削除、および圧縮モデル用のコンパクトなデータフォーマット(BSPC)を含む、コンパイラ支援最適化を導入する。
  • フィルターやチャネル全体で構造的規則性を維持するブロック単位の pruning 戦略を採用し、モバイル GPU での効率的なメモリアクセスと並列処理を可能にする。
  • 高精度を維持するため、GRU モデルの学習とファインチューニングに PyTorch-Kaldi ツールキットを活用する。
  • コンパイル時にコード生成とデータレイアウトを最適化し、GPU の利用度を最大化するとともに、メモリスタールを最小限に抑える。
  • 評価にはモバイル GPU(Adreno 640)と CPU プラットフォームを用い、FPGA ベースの ESE や他の最先端手法と性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1モバイルデバイス上で RNN 推論精度を劣化させずに、高い圧縮率を達成できる pruning 戦略は可能か?
  • RQ2コンパイラレベルの最適化は、圧縮された RNN に対してモバイル GPU の推論速度とエネルギー効率を顕著に向上させられるか?
  • RQ3FPGA らような専用ハードウェアに依存せずに、GPU ベースの加速のみでモバイルプラットフォーム上でリアルタイム RNN 推論を達成できるか?
  • RQ4細粒度の構造的 pruning とコード生成の組み合わせは、モデルサイズ、精度、計算効率のトレードオフにどのように影響を与えるか?
  • RQ5リアルタイム性能を維持しつつ、最小限の精度損失で達成可能な圧縮率の上限は何か?

主な発見

  • RTMobile は、精度の低下なしに 10 倍以上のモデル圧縮を達成し、ESE や C-LSTM よりも圧縮率と推論精度の両面で優れている。
  • 245 倍の圧縮率において、モデルパラメータを 3.25M 個から 0.04M 個に削減しながら、電話誤り率(PER)を 24.20% に維持し、ベースラインの C-LSTM モデル(24.15%)と同等の精度を達成した。
  • Adreno 640 モバイル GPU 上で、ESE に比べてエネルギー効率が 40 倍向上した。ESE は高消費電力の FPGA プラットフォーム(41W)を採用している。
  • ESE と同等の推論時間(82.7 μs)を維持しながら、最適化されたメモリアクセスと並列処理のおかげで、はるかに高いエネルギー効率を達成した。
  • 圧縮率が 250 倍を超えると、推論スピードアップの安定化が見られ、BSP とコンパイラ最適化のおかげで計算とメモリのボトル neck が効果的に軽減されたことが示された。
  • BSPC のコンパクトフォーマットとコンパイラ最適化により、メモリアクセスの不規則性が低減され、GPU 利用度が向上し、超高圧縮率でも高い GOP/s を実現できた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。