Skip to main content
QUICK REVIEW

[論文レビュー] Very Deep Multilingual Convolutional Neural Networks for LVCSR

Tom Sercu, Christian Puhrsch|arXiv (Cornell University)|Sep 29, 2015
Speech Recognition and Synthesis参考文献 27被引用数 6
ひとこと要約

本稿では、14層の重み層を備えたVGGにインspiredされたアーキテクチャ、3×3の小さなカーネル、プーリング層ごとに複数の畳み込み層を用いた、大ボキャブラリー連続音声認識(LVCSR)向けの非常に深い多言語畳み込みニューラルネットワーク(CNN)を提案する。Hub5'00では1.4%の絶対的WER改善(10.6%相対的)を達成し、11.8% WERに到達した。また、6言語を統合して同時に学習することで、低リソースのBabelタスクで5.77% WER改善を達成した。

ABSTRACT

Convolutional neural networks (CNNs) are a standard component of many current state-of-the-art Large Vocabulary Continuous Speech Recognition (LVCSR) systems. However, CNNs in LVCSR have not kept pace with recent advances in other domains where deeper neural networks provide superior performance. In this paper we propose a number of architectural advances in CNNs for LVCSR. First, we introduce a very deep convolutional network architecture with up to 14 weight layers. There are multiple convolutional layers before each pooling layer, with small 3x3 kernels, inspired by the VGG Imagenet 2014 architecture. Then, we introduce multilingual CNNs with multiple untied layers. Finally, we introduce multi-scale input features aimed at exploiting more context at negligible computational cost. We evaluate the improvements first on a Babel task for low resource speech recognition, obtaining an absolute 5.77% WER improvement over the baseline PLP DNN by training our CNN on the combined data of six different languages. We then evaluate the very deep CNNs on the Hub5'00 benchmark (using the 262 hours of SWB-1 training data) achieving a word error rate of 11.8% after cross-entropy training, a 1.4% WER improvement (10.6% relative) over the best published CNN result so far.

研究の動機と目的

  • 非常に深いCNNアーキテクチャ(VGG ImageNet 2014モデルにインspired)を、まだ広く採用されていない深いネットワークが活用されていない大ボキャブラリー連続音声認識(LVCSR)に適応すること。
  • 6言語のデータを統合して学習することで、言語間で共有される音声表現を活用し、低リソース環境における音声認識性能を向上させること。
  • 計算コストをほとんど増加させずに、より広い音声的文脈を捉えることができるマルチスケール入力特徴を用いて、文脈モデリングを強化すること。
  • Hub5'00やBabel低リソースタスクといった標準ベンチマークで、提案された深層CNNアーキテクチャの性能を評価し、従来のCNNベースおよびDNNベースのシステムよりも性能向上を示すこと。

提案手法

  • プーリング層の前後に3×3畳み込みカーネルをブロックでスタックし、VGGスタイルのアーキテクチャを採用。重み層を14層(10層の畳み込み層、4層の全結合層)に拡張。大きなカーネルとシグモイド活性化関数の代わりに、小さなカーネルとReLU非線形性を採用。
  • 言語固有の特徴学習を可能にするために、層をアンタイード(united)にし、より深い表現を共有する多言語CNNを導入。これにより、低リソース環境での一般化性能が向上する。
  • 異なる時間的解像度の入力スペクトログラムを組み合わせることでマルチスケール入力特徴を実装。ネットワークが局所的および広範な文脈を効率的に捉えることを可能にする。
  • 深層ネットワークの学習に適応的最適化アルゴリズム(AdadeltaとAdam)を用い、2段階戦略を採用:初期段階で適応的手法で学習し、その後SGDで微調整することで収束性と性能を向上。
  • Hub5'00実験では、発話者依存VTLNとデルタ/ダブルデルタ特徴を適用。クラスの不均衡を補うために、データバランス要因γ=0.8を用いた。
  • 交差エントロピー目的関数でモデルを学習し、Hub5'00 SWBおよびBabel低リソースタスクといった標準ベンチマークで評価。古典的CNNおよびDNNベースラインと比較。

実験結果

リサーチクエスチョン

  • RQ1小さな3×3カーネルとプーリング層ごとの複数畳み込み層を備えた非常に深いCNNアーキテクチャは、浅い古典的CNNと比較してLVCSR性能を向上させることができるか?
  • RQ2アンタイド層を用いた多言語学習は、低リソース音声認識タスクの性能向上にどの程度効果的か?
  • RQ3マルチスケール入力特徴は、計算コストをほとんど増加させずにLVCSRにおける音声モデリングを向上させることができるか?
  • RQ4Adadelta/Adamといった適応的最適化手法で学習し、その後SGDで微調整する戦略は、LVCSRにおいて標準的な学習戦略をどの程度上回るか?
  • RQ5提案された深層多言語CNNは、Hub5'00や低リソースBabelタスクといった標準ベンチマークで、従来の最先端CNNおよびDNNシステムと比較してどの程度の性能向上を達成するか?

主な発見

  • 提案された非常に深いCNN(14層の重み層)は、交差エントロピー学習後、Hub5'00 SWBベンチマークで11.8% WERを達成。当時発表済みの最高のCNN結果と比較して、1.4%の絶対的WER改善(10.6%相対的)を達成した。
  • Babel低リソースタスクでは、6言語のデータを統合して学習した多言語CNNにより、ベースラインのPLP DNNと比較して5.77%の絶対的WER改善が達成され、低リソース環境での顕著な向上が示された。
  • Adadeltaで学習し、その後SGDで微調整したモデルは、92.1MフレームのHub5'00トレーニングセットを1.5回通過するだけで12.2% WERに到達した。適切な最適化により、収束が速いことが示された。
  • SGDのみでトレーニングを開始したモデルは、3.5回のデータ通過で11.8% WERの最良性能を達成。長時間のトレーニングを要するが、完全なSGDトレーニングが優れた結果をもたらすことを示した。
  • マルチスケール特徴の導入により、計算コストをほとんど増加させずに文脈モデリングが向上し、低リソースおよび標準ベンチマークの両方で性能向上に寄与した。
  • 結果から、ImageNetの成功にインspiredされたより深いCNNアーキテクチャがLVCSRにおいて非常に有効であることが示され、多言語事前学習およびマルチスケール入力処理によってさらなる向上が可能であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。