Skip to main content
QUICK REVIEW

[論文レビュー] Leveraging End-to-End Speech Recognition with Neural Architecture Search

Ahmed Baruwa, Mojeed Abisiga|arXiv (Cornell University)|Dec 11, 2019
Speech Recognition and Synthesis参考文献 39被引用数 8
ひとこと要約

この論文は、最小限の計算コストで最適化されたDNNアーキテクチャを発見することで、エンドツーエンド音声認識を高速化するニューラルアーキテクチャサーチ(NAS)フレームワークを提案する。7% WER(LibriSpeech)および13% PER(TIMIT)という最先端の性能を、数時間で達成し、アテンションベースのseq2seqモデルよりも高速に学習しながら、高い精度を維持している。

ABSTRACT

Deep neural networks (DNNs) have been demonstrated to outperform many traditional machine learning algorithms in Automatic Speech Recognition (ASR). In this paper, we show that a large improvement in the accuracy of deep speech models can be achieved with effective Neural Architecture Optimization at a very low computational cost. Phone recognition tests with the popular LibriSpeech and TIMIT benchmarks proved this fact by displaying the ability to discover and train novel candidate models within a few hours (less than a day) many times faster than the attention-based seq2seq models. Our method achieves test error of 7% Word Error Rate (WER) on the LibriSpeech corpus and 13% Phone Error Rate (PER) on the TIMIT corpus, on par with state-of-the-art results.

研究の動機と目的

  • エンドツーエンド音声認識のための高精度な深層学習モデルを、効果的なニューラルアーキテクチャ最適化によって向上させること。
  • 自動音声認識における最適なニューラルネットワークアーキテクチャを探索する際の、通常の計算コストを低減すること。
  • 従来のアテンションベースのseq2seqアプローチと比較して、モデル発見と学習を高速化すること。
  • 軽量な探索プロセスを用いて、LibriSpeechやTIMITなどの標準ベンチマークで最先端の性能を達成すること。

提案手法

  • 本手法は、エンドツーエンド音声認識のための新規で高性能な深層ニューラルネットワークアーキテクチャを自動的に発見するために、ニューラルアーキテクチャサーチ(NAS)を採用する。
  • 手動で設計されたものやアテンションベースのモデルに依存するのではなく、DNNのアーキテクチャ最適化に焦点を当てる。
  • 探索プロセスは計算効率が高く、1日未満で候補モデルを発見できるように設計されている。
  • 発見されたモデルは、LibriSpeech や TIMIT といった標準ベンチマークで訓練および評価される。
  • 畳み込み層、残差接続、活性化関数などのさまざまなアーキテクチャ的要素を含む探索空間を活用する。
  • 最終的なモデルは、標準指標(語彙誤り率(WER)と音素誤り率(PER))を用いて評価される。

実験結果

リサーチクエスチョン

  • RQ1ニューラルアーキテクチャサーチは、計算コストを低く抑えながら、エンドツーエンド音声認識モデルの精度を顕著に向上させることができるか?
  • RQ2標準ASRベンチマークにおいて、NASベースのモデル発見はアテンションベースのseq2seqモデルと比較して、速度と性能で優れているか?
  • RQ3NAS最適化DNNを用いることで、LibriSpeechおよびTIMITでどの程度のWERとPER性能を達成できるか?
  • RQ4精度を損なわずに、数時間で効果的なニューラルアーキテクチャ最適化を達成できるか?
  • RQ5NASは、既存の最先端モデルを上回る新しいアーキテクチャを発見可能か?

主な発見

  • 提案されたNASフレームワークは、LibriSpeechコーパスでテスト語彙誤り率(WER)7%を達成し、最先端の性能に一致した。
  • TIMITコーパスでは、音素誤り率(PER)13%を達成し、報告済みの最高水準と同等の結果を得た。
  • モデル発見および学習プロセスは1日未塔で完了し、アテンションベースのseq2seqモデルの学習よりも顕著に高速だった。
  • 本手法は、高い精度を維持しながらも、計算コストを低く抑えつつ、効果的なニューラルアーキテクチャ最適化が可能であることを示した。
  • NAS最適化モデルは、従来のDNNを上回り、学習速度においてアテンションベースのモデルと同等またはそれを上回る性能を示した。
  • 結果から、NASは高パフォーマンスな音声認識アーキテクチャを発見するための実用的で効率的なアプローチであることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。