Skip to main content
QUICK REVIEW

[論文レビュー] Hardware-Guided Symbiotic Training for Compact, Accurate, yet Execution-Efficient LSTM

Hongxu Yin, Guoyang Chen|arXiv (Cornell University)|Jan 30, 2019
Advanced Neural Network Applications参考文献 32被引用数 8
ひとこと要約

この論文は、現代のハードウェアにおける遅延ヒステリシス効果(LHE)——モデルサイズと推論遅延の間の非単調な関係——を活用することで、モデルのコンactness、精度、推論効率を共同最適化する、ハードウェアに配慮した共生的トレーニング手法を提案している。マルチスケールの成長・ pruning アルゴリズムとハードウェアに配慮したアーキテクチャ探索を組み合わせることで、精度を損なわずにCPU上で最大30.5倍のパラメータ削減と5.2倍の遅延削減を達成し、音声認識タスクでは精度を向上させた。

ABSTRACT

Many long short-term memory (LSTM) applications need fast yet compact models. Neural network compression approaches, such as the grow-and-prune paradigm, have proved to be promising for cutting down network complexity by skipping insignificant weights. However, current compression strategies are mostly hardware-agnostic and network complexity reduction does not always translate into execution efficiency. In this work, we propose a hardware-guided symbiotic training methodology for compact, accurate, yet execution-efficient inference models. It is based on our observation that hardware may introduce substantial non-monotonic behavior, which we call the latency hysteresis effect, when evaluating network size vs. inference latency. This observation raises question about the mainstream smaller-dimension-is-better compression strategy, which often leads to a sub-optimal model architecture. By leveraging the hardware-impacted hysteresis effect and sparsity, we are able to achieve the symbiosis of model compactness and accuracy with execution efficiency, thus reducing LSTM latency while increasing its accuracy. We have evaluated our algorithms on language modeling and speech recognition applications. Relative to the traditional stacked LSTM architecture obtained for the Penn Treebank dataset, we reduce the number of parameters by 18.0x (30.5x) and measured run-time latency by up to 2.4x (5.2x) on Nvidia GPUs (Intel Xeon CPUs) without any accuracy degradation. For the DeepSpeech2 architecture obtained for the AN4 dataset, we reduce the number of parameters by 7.0x (19.4x), word error rate from 12.9% to 9.9% (10.4%), and measured run-time latency by up to 1.7x (2.4x) on Nvidia GPUs (Intel Xeon CPUs). Thus, our method yields compact, accurate, yet execution-efficient inference models.

研究の動機と目的

  • 現在のニューラルネットワーク圧縮手法がハードウェアに無関係であり、モデルサイズを小さくしても実行効率が向上しないというギャップに対処すること。
  • 特に遅延ヒステリシス効果(LHE)——ハードウェア固有の非単調な挙動——が、モデルサイズ、精度、推論遅延のトレードオフに与える影響を調査すること。
  • ハードウェアに影響を受けるLHEと構造的スパarsityを活用することで、モデルのコンactness、推論精度、実行効率を共生的に最適化するトレーニング手法を開発すること。
  • 実世界のNLPおよび音声認識ワークロードにおけるGPUおよびCPUの両方で、パラメータ数、精度、実行時間遅延の3つの次元において、既存手法を上回ること。

提案手法

  • この手法はスパースな初期アーキテクチャから出発し、ハードウェア固有の遅延測定に従って、繰り返しネットワークを精緻化する構造的成長・pruningプロセスを適用する。
  • 異なるハードウェアプラットフォーム向けに最適な隠れ層次元(LHPs)を特定する、ハードウェアに配慮したアーキテクチャ探索を導入し、非効率な設計ポイントを回避する。
  • 重みレベルおよびレイヤーレベルの両方でマルチスケールのpruningを適用し、ハードウェアフィードバックに基づいてpruning比を動的に調整することで、精度を保持しつつ効率を最大化する。
  • 小さなモデルがメモリアクセスの非効率さやカーネル起動のオーバーヘッドにより遅くなるという、遅延ヒステリシス効果(LHE)を活用して、こうした性能の落とし穴を回避する。
  • GPU推論では、ハードウェア最適化された行列サイズ(例:626/626)に合わせて次元を低減することで、GPU全体で2〜30%の遅延削減を達成した。
  • CPU推論では、次元低減を避け、重みスパarsityを最大94.2%まで高めることで、Intel MKLのスパースカーネル加速を最大限に活用し、追加で1.4倍の遅延削減を実現した。

実験結果

リサーチクエスチョン

  • RQ1ハードウェアに影響を受ける遅延ヒステリシス(LHE)は、LSTMにおけるモデルサイズと推論遅延の関係にどのように影響するか?
  • RQ2ハードウェアに配慮したトレーニング戦略は、サイズは小さいが実行効率が悪い非効率なモデルアーキテクチャを回避できるか?
  • RQ3実際のハードウェア遅延フィードバックに従って、マルチスケールの成長・pruningアルゴリズムが、コンactness、精度、実行効率の共生をどの程度向上できるか?
  • RQ4構造的pruningとハードウェアに配慮した次元チューニングの組み合わせが、GPUおよびCPUにおける推論速度とモデル精度に与える影響は何か?
  • RQ5Intel MKLのような最適化ライブラリを用いて、CPU上で高い重みスパarsityを効果的に活用できるか?その場合の性能向上はどの程度か?

主な発見

  • Penn Treebank言語モデリングタスクでは、Nvidia GPU上でモデルパラメータを18.0倍削減し、推論遅延を最大2.4倍短縮した。Intel Xeon CPU上では、30.5倍と5.2倍の削減を達成し、精度に劣化は認めなかった。
  • AN4音声認識タスクでは、GPU上でパラメータを7.0倍、遅延を最大1.7倍削減した。CPU上では、19.4倍と2.4倍の削減を達成し、語誤り率(WER)をGPUで12.9%から9.9%へ、CPUで10.4%へ改善した。
  • 音声認識用CPU推論モデルの最終形態は、わずか260万パラメータ(19.4倍圧縮)であり、Intel Broadwell CPU上で遅延を54.8%削減(2.2倍の高速化)し、WERは10.37%にまで低下した。これはベースライン比で2.53%の精度向上である。
  • 言語モデリングタスクでは、CPUで最大5.2倍、GPUで最大2.4倍の遅延削減を達成した。これは、単なるパラメータ削減を超えて、ハードウェアに配慮した設計が顕著な効率向上をもたらすことを示している。
  • CPUでは次元低減を避け、スパarsityを最大94.2%まで高めることで、Intel MKLのスパースカーネル加速を完全に活用し、約2倍の高速化を達成した。残りの1.1倍の高速化はH-LSTMセル最適化によるものである。
  • この手法は非効率な設計ポイントを効果的に回避し、有効なモデルアーキテクチャ探索空間を最大90%まで縮小した。また、コンactness、精度、実行効率の3つの指標すべてにおいて、先行研究を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。