Skip to main content
QUICK REVIEW

[論文レビュー] Deep Recurrent Convolutional Neural Network: Improving Performance For Speech Recognition

Zewang Zhang, Zheng Sun|arXiv (Cornell University)|Nov 22, 2016
Speech Recognition and Synthesis参考文献 37被引用数 17
ひとこと要約

本稿では、従来のCNN-RNNの順序を逆転させ、再帰層を畳み込み層の前に配置することで、音声認識における学習効率と認識精度を向上させる、新しい深層再帰的畳み込みニューラルネットワーク(RCNN)アーキテクチャを提案する。深層残差学習を統合することで、収束が速くなり、TIMITデータセット上で最先端の発音誤り率(PER)17.33%を達成した。これは、標準的および残差拡張型ベースラインモデルを上回る結果である。

ABSTRACT

A deep learning approach has been widely applied in sequence modeling problems. In terms of automatic speech recognition (ASR), its performance has significantly been improved by increasing large speech corpus and deeper neural network. Especially, recurrent neural network and deep convolutional neural network have been applied in ASR successfully. Given the arising problem of training speed, we build a novel deep recurrent convolutional network for acoustic modeling and then apply deep residual learning to it. Our experiments show that it has not only faster convergence speed but better recognition accuracy over traditional deep convolutional recurrent network. In the experiments, we compare the convergence speed of our novel deep recurrent convolutional networks and traditional deep convolutional recurrent networks. With faster convergence speed, our novel deep recurrent convolutional networks can reach the comparable performance. We further show that applying deep residual learning can boost the convergence speed of our novel deep recurret convolutional networks. Finally, we evaluate all our experimental networks by phoneme error rate (PER) with our proposed bidirectional statistical n-gram language model. Our evaluation results show that our newly proposed deep recurrent convolutional network applied with deep residual learning can reach the best PER of 17.33\% with the fastest convergence speed on TIMIT database. The outstanding performance of our novel deep recurrent convolutional neural network with deep residual learning indicates that it can be potentially adopted in other sequential problems.

研究の動機と目的

  • 音声認識(ASR)における従来の深層畳み込み再帰ネットワーク(CRNN)の収束が遅く、学習に時間がかかる問題を解決すること。
  • 再帰層を畳み込み層の前に配置することで、ネットワークアーキテクチャの順序を再設計し、認識精度と学習効率を向上させること。
  • 提案されたアーキテクチャにおける深層残差学習の有効性を検証し、収束速度と認識性能の両方の向上を図ること。
  • 双方向統計的n-gram言語モデルを用いて提案モデルを評価し、標準的CRNNおよび残差バージョンと比較すること。

提案手法

  • 再帰層を畳み込み層の前に配置することで、従来のCRNN構造とは逆の順序を持つ新しいアーキテクチャRCNNを提案する。
  • 収束を加速し、学習を安定化させるために、恒等写像としてのショートカット接続を用いて残差学習を適用する。
  • 事前に分割されたデータを必要としないエンドツーエンド学習のため、接続主義的時系列分類(CTC)を用いる。
  • 発音語彙列のデコードと精緻化に、全学習セットを用いて事前学習された双方向統計的n-gram言語モデルを採用する。
  • ミニバッチ確率的勾配降下法を用い、バッチ正規化とReLU活性化関数を適用してモデルを学習する。
  • 複数のバリエーションを比較:CR1–CR4(標準的CRNN)、RC1–RC6(提案されたRCNN)、Res-RC2/Res-CR2(残差バージョン)。

実験結果

リサーチクエスチョン

  • RQ1再帰層を畳み込み層の前に配置することで、音声認識における収束速度と認識精度が向上するか?
  • RQ2深層残差学習は、提案された再帰的畳み込みネットワークアーキテクチャにおいて、収束速度の加速と性能向上に顕著な効果をもたらすか?
  • RQ3標準的CRNNと比較して、提案されたRCNNアーキテクチャは発音誤り率(PER)と学習効率の点で優れているか?
  • RQ4深層CRNNに残差ブロックを適用した際に性能劣化が生じる原因は何か、そしてその対処法は?

主な発見

  • 提案されたRC2モデルは、テスト発音誤り率(PER)が20.71%を達成し、従来の深層信念ネットワークと比較して競争力のある性能を示した。
  • CR2モデルはPERが18.73%とRC2を上回ったが、より長い学習時間を要した。
  • Res-RC2モデルは、最も速い収束速度を示し、テストPERが17.33%という最良の結果を達成した。これは、新しいアーキテクチャにおける残差学習の有効性を示している。
  • Res-CR2モデルはCR2と比較してわずかな改善(PER18.90%)にとどまり、これは残差ブロックの深さが性能向上を制限している可能性がある。
  • RCNNアーキテクチャは、学習の前半において標準的CRNNよりも速く収束しており、最適化ダイナミクスの改善が示唆される。
  • Res-CR2の劣化は、その残差ブロックの極めて深い構造と、上位の再帰層が収束に与える影響に起因すると考えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。