Skip to main content
QUICK REVIEW

[論文レビュー] A comprehensive study of batch construction strategies for recurrent neural networks in MXNet

Patrick Doetsch, Pavel Golik|arXiv (Cornell University)|May 5, 2017
Speech Recognition and Synthesis参考文献 10被引用数 5
ひとこと要約

この論文は、再帰的ニューラルネットワークの訓練におけるバッチ構築のための入れ替え式ソーティング戦略を提案している。シャッフルされたシーケンスが分割され、交互に順序付けられることで、ゼロパディングを削減し、訓練効率を向上させる。CHiME-4 ASRタスクにおいて評価された結果、ランダムシャッフルと同等の認識性能(WER ~8.9%)を達成しながら、ソーティングバッチの速度に匹敵する結果を示し、MXNetのバケット化手法よりも単純で効果的な代替手法を提供する。

ABSTRACT

In this work we compare different batch construction methods for mini-batch training of recurrent neural networks. While popular implementations like TensorFlow and MXNet suggest a bucketing approach to improve the parallelization capabilities of the recurrent training process, we propose a simple ordering strategy that arranges the training sequences in a stochastic alternatingly sorted way. We compare our method to sequence bucketing as well as various other batch construction strategies on the CHiME-4 noisy speech recognition corpus. The experiments show that our alternated sorting approach is able to compete both in training time and recognition performance while being conceptually simpler to implement.

研究の動機と目的

  • 可変長シーケンスによるRNNミニバッチ訓練におけるゼロパディングの非効率性を解決すること。
  • パディングフレームに起因する計算の無駄を減らすことで、訓練速度と認識性能を向上させること。
  • MXNetにおける既存のバケット化手法よりも単純で直感的なバッチ構築戦略を提案すること。
  • バッチ構築戦略が訓練時間とASRシステム性能に与える影響を評価すること。
  • 確率的に入れ替えたソーティングアプローチが、速度と正確性の両面で標準的なバケット化を上回ることを示すこと。

提案手法

  • 長さ順のバイアスを回避するために、まずシーケンスをランダムにシャッフルする。
  • シャッフルされたシーケンスを固定サイズのセグメントに分割する。
  • 全訓練セット全体にわたり、奇数セグメントでは増加順、偶数セグメントでは減少順に、交互にソートする。
  • この方法により、バッチ内での長さのばらつきを低減しながら、バッチ間の多様性を維持する。
  • 各セグメント内で長さが類似したシーケンスをグループ化することで、ゼロパディングを最小限に抑える。
  • この手法はMXNetに実装され、ランダムシャッフル、ソーティングバッチ、MXNetのネイティブバケット化戦略と比較された。

実験結果

リサーチクエスチョン

  • RQ1RNNベースのASRにおけるバッチ構築戦略は、訓練時間と認識性能にどのように影響するか?
  • RQ2より単純なバッチ構築手法が、MXNetにおける標準的なバケット化手法を上回ることができるか?
  • RQ3シャッフルされたシーケンスセグメントの入れ替えソーティングは、ゼロパディングを低減し、訓練効率を向上させることができるか?
  • RQ4さまざまなバッチ構築戦略において、訓練速度とASR精度のトレードオフはどのように変化するか?
  • RQ5バッチ内での長さのばらつきは、モデルの収束と性能にどのように影響するか?

主な発見

  • 提案された入れ替えソーティング手法は、1秒あたり10.0発話(utt/sec)で語誤り率(WER)9.5%を達成し、ランダムシャッフル(WER ~8.9%、約7.0 utt/sec)とほぼ同等の性能を示した。
  • ソーティングバッチは最速の訓練速度(10.2 utt/sec)を達成したが、認識性能が最悪(WER 10.2%)であり、固定長順序の強い悪影響が示された。
  • MXNetのバケット化手法は、提案手法(256バケットの場合、4.8–6.0 GB、8.8–10.1 utt/sec)と比較して、より高いメモリ消費量(6.3 GB)と遅い訓練速度(9.5 utt/sec)を示した。
  • 256バケットを用いた提案手法はWER 9.1%を達成し、MXNetのバケット化(9.6%)を上回り、ランダムシャッフルの性能に近づいた。
  • 入れ替えソーティング戦略は、バケット化およびソーティングバッチと比較して、訓練速度と認識正確性の両面でより良いバランスを達成した。
  • この手法は、バケットサイズや分布のチューニングが不要なため、バケット化よりも実装およびパrameter設定が単純である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。