Skip to main content
QUICK REVIEW

[論文レビュー] Neural Architecture Search for Speech Recognition.

Shoukang Hu, Xurong Xie|arXiv (Cornell University)|Jul 17, 2020
Speech Recognition and Synthesis被引用数 7
ひとこと要約

本論文は、因子分解時遅延ニューラルネットワーク(TDNN-F)音声モデルにおける2つの重要なハイパーパrameter(スプライシングコンテキストオフセットおよびボトルネック射影次元)を自動で最適化するニューラルアーキテクチャ探索(NAS)フレームワークを提案する。Lattice-free MMI(LF-MMI)学習においてDARTS、Gumbel-Softmax DARTS、Pipelined DARTS、Penalized DARTSを適用することで、300時間のSwitchboardタスクにおいて、手動で最適化されたベースラインと比較して1.0%の絶対的単語誤り率(WER)低減と28%のモデルサイズ削減を達成した。

ABSTRACT

Deep neural networks (DNNs) based automatic speech recognition (ASR) systems are often designed using expert knowledge and empirical evaluation. In this paper, a range of neural architecture search (NAS) techniques are used to automatically learn two hyper-parameters that heavily affect the performance and model complexity of state-of-the-art factored time delay neural network (TDNN-F) acoustic models: i) the left and right splicing context offsets; and ii) the dimensionality of the bottleneck linear projection at each hidden layer. These include the standard DARTS method fully integrating the estimation of architecture weights and TDNN parameters in lattice-free MMI (LF-MMI) training; Gumbel-Softmax DARTS that reduces the confusion between candidate architectures; Pipelined DARTS that circumvents the overfitting of architecture weights using held-out data; and Penalized DARTS that further incorporates resource constraints to adjust the trade-off between performance and system complexity. Parameter sharing among candidate architectures was also used to facilitate efficient search over up to $7^{28}$ different TDNN systems. Experiments conducted on a 300-hour Switchboard conversational telephone speech recognition task suggest the NAS auto-configured TDNN-F systems consistently outperform the baseline LF-MMI trained TDNN-F systems using manual expert configurations. Absolute word error rate reductions up to 1.0% and relative model size reduction of 28% were obtained.

研究の動機と目的

  • TDNN-F音声モデルにおける重要なハイパーパrameterの設定を自動化し、人的なエキスパートチューニングへの依存を低減すること。
  • スプライシングコンテキストオフセットとボトルネック射影次元を同時に最適化することで、自動音声認識性能を向上させること。
  • NAS中にリソース制約を組み込むことで、モデルの精度と複雑さのバランスをとること。
  • パラメータ共有を用いることで、最大7^28種類の異なるTDNN構成を含む膨大な探索空間に対して効率的な探索を可能とすること。
  • 標準的なASRベンチマーク上で、LF-MMIで訓練されたTDNN-Fシステムの改善を図る複数のNASバリエーションの有効性を評価すること。

提案手法

  • Lattice-free MMI(LF-MMI)学習中に、アーキテクチャ重み(スプライシングコンテキストとボトルネック次元)とモデルパラメータを同時に最適化するために、DARTSの微分可能アーキテクチャ探索フレームワークを適用する。
  • 候補演算の微分可能サンプリングを可能にすることで、アーキテクチャの混乱を軽減し、探索の安定性を向上させるために、Gumbel-Softmax DARTSを採用する。
  • 探索プロセス中のアーキテクチャ重みの過学習を防ぐために、ホールドアウトデータを用いたPipelined DARTSを用いる。
  • モデル性能と複雑さのバランスを明示的に保つために、リソース制約を直接強制するPenalized DARTSを導入する。
  • 候補アーキテクチャ間でパラメータ共有を実装することで、計算コストを著しく削減し、7^28サイズの探索空間における探索を可能にする。
  • エンドツーエンドのLF-MMI学習と微分可能アーキテクチャ探索を統合することで、モデルパラメータとアーキテクチャパラメータの両方を勾配ベースで最適化可能にする。

実験結果

リサーチクエスチョン

  • RQ1NASは、TDNN-Fモデルにおけるスプライシングコンテキストオフセットとボトルネック次元の設定を効果的に自動化できるか?
  • RQ2DARTS、Gumbel-Softmax DARTS、Pipelined DARTS、Penalized DARTSといった異なるNASバリエーションは、TDNN-F音声モデルの最適化においてどのように比較されるか?
  • RQ3手動チューニングと比較して、NASはどれほどモデルサイズを削減できるか、かつASR性能を維持または向上させられるか?
  • RQ4パラメータ共有を用いることで、7^28通りの可能なTDNN構成を含む極めて大きな探索空間における効率的探索が可能になるか?
  • RQ5NASは、標準的な300時間のSwitchboard ASRベンチマークにおいて、一貫した単語誤り率の改善をもたらすか?

主な発見

  • NASで最適化されたTDNN-Fシステムは、手動で設定されたベースラインと比較して、最大1.0%の絶対的単語誤り率(WER)低減を達成した。
  • NASアプローチにより、ベースライン比で28%のモデルサイズ削減が達成され、効果的な複雑さ制御が示された。
  • すべてのNASバリエーション、特にPipelined DARTSとPenalized DARTSは、標準DARTSと比較して一般化性能が向上し、過学習が軽減された。
  • パラメータ共有の導入により、最大7^28個の異なるTDNN構成を含む探索空間における効率的探索が可能になった。
  • NASで最適化されたモデルは、Switchboard 300時間データセットにおける複数の評価指標で、エキスパートチューニングベースラインを一貫して上回った。
  • Penalized DARTSは、探索中に明示的なリソース制約を組み込むことで、性能とモデル複雑さのバランスを成功裏に実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。