Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Implementation of the Room Simulator for Training Deep Neural Network Acoustic Models

Chanwoo Kim, Ehsan Variani|arXiv (Cornell University)|Dec 9, 2017
Speech and Audio Processing参考文献 32被引用数 3
ひとこと要約

本論文では、深層ニューラルネットワーク音響モデルのデータ生成を高速化するために、FFTW3を用いたFFTを用いた重ね合わせ法(OLA)フィルタリングを用いた、CPUベースの効率的なルームシミュレータの実装を提示する。ルームインパulse応答(RIR)をピークパワーに対して20 dB未満に切り詰めることで、CPU使用率を80%から9.69%に低下させ、Googleの分散トレーニングインfraストラクチャ上での37.3倍の高速化を達成したが、シミュレートされたまたは再録音された遠方音声テストセットにおける音声認識精度は劣化しなかった。

ABSTRACT

In this paper, we describe how to efficiently implement an acoustic room simulator to generate large-scale simulated data for training deep neural networks. Even though Google Room Simulator in [1] was shown to be quite effective in reducing the Word Error Rates (WERs) for far-field applications by generating simulated far-field training sets, it requires a very large number of Fast Fourier Transforms (FFTs) of large size. Room Simulator in [1] used approximately 80 percent of Central Processing Unit (CPU) usage in our CPU + Graphics Processing Unit (GPU) training architecture [2]. In this work, we implement an efficient OverLap Addition (OLA) based filtering using the open-source FFTW3 library. Further, we investigate the effects of the Room Impulse Response (RIR) lengths. Experimentally, we conclude that we can cut the tail portions of RIRs whose power is less than 20 dB below the maximum power without sacrificing the speech recognition accuracy. However, we observe that cutting RIR tail more than this threshold harms the speech recognition accuracy for rerecorded test sets. Using these approaches, we were able to reduce CPU usage for the room simulator portion down to 9.69 percent in CPU/GPU training architecture. Profiling result shows that we obtain 22.4 times speed-up on a single machine and 37.3 times speed up on Google's distributed training infrastructure.

研究の動機と目的

  • 遠方音声認識のためのディープラーニングトレーニング中に生じるルームシミュレーションによる高いCPUオーバーヘッドを低減すること。
  • 畳み込みRIRフィルタリングを用いた大規模なシミュレートされた遠方トレーニングデータの生成における計算ボトルネックを解決すること。
  • RIRの切り詰めが音声認識性能に与える影響を調査し、計算効率を最適化すること。
  • CPU/GPUアーキテクチャにおけるルームシミュレータの計算負荷を最小限に抑えることで、スケーラブルな分散トレーニングを可能にすること。

提案手法

  • オープンソースのFFTW3ライブラリを用いて、効率的なオーバーラップ・アド(OLA)ベースのフィルタリング手法を実装し、畳み込み演算を高速化する。
  • 画像法を用いて、反射壁を持つ3次元直方体ルーム内でルームインパulse応答(RIR)をモデル化し、仮想音源と距離に基づくパスロスを適用する。
  • 各トレーニングエポックごとに、反射係数と音源位置にランダムな分布を適用し、多様な音響環境を生成する。
  • ピーク振幅に対して20 dB未満のパワーに低下する点以降のRIRを切り詰めることで、計算量を削減しつつ精度を損なわないようにする。
  • 最適化されたシミュレータをCPU/GPUトレーニングパイプラインに統合し、特徴抽出およびGPU上でのモデルトレーニングの前に、シミュレートされた発話文を生成する。
  • 単一マシンおよびGoogleのBorgクラスタ上でCPU使用率と高速化をプロファイリングし、性能向上を検証する。

実験結果

リサーチクエスチョン

  • RQ1遠方シナリオにおいて音声認識精度を維持するために必要な最小RIR長さは何か?
  • RQ2特定のパワー閾値未満にRIRを切り詰めることで、シミュレートされたテストセットおよび実世界の再録音テストセットにおける認識性能にどのような影響が生じるか?
  • RQ3FFTW3を用いたOLAベースのフィルタリングは、CPU/GPUトレーニングパイプラインにおけるCPU使用率をどの程度低減できるか?
  • RQ4モデル精度を劣化させることなく、分散トレーニング環境で顕著な高速化を達成できるか?

主な発見

  • ピークパワーに対して20 dB未満のRIRを切り詰めることで、シミュレートされたおよび再録音された遠方テストセットにおいて、語誤り率(WER)に測定可能な劣化が生じない。
  • ピークパワーに対して5 dB未満にRIRを切り詰めると、特に混浊状態下で認識精度が著しく低下するため、RIRの長尾部成分が耐障害性に不可欠であることが示された。
  • FFTW3を用いた最適化されたOLAベースのフィルタリングにより、CPU/GPUトレーニングアーキテクチャにおけるルームシミュレータのCPU使用率が80%から9.69%に低下した。
  • 本手法により、単一マシン上では22.4倍、Googleの分散Borgクラスタ上では37.3倍の高速化が達成された。
  • 性能向上の主な要因は、RIRの切り詰めによるFFT計算量の削減と、FFTW3を用いた効率的なOLAフィルタリングに起因する。
  • 本アプローチにより、モデル精度を損なわせることなく、遠方音声認識のためのスケーラブルかつ高スルーレートのデータ拡張が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。