Skip to main content
QUICK REVIEW

[論文レビュー] Multitask Learning with CTC and Segmental CRF for Speech Recognition

Liang Lu, Lingpeng Kong|arXiv (Cornell University)|Feb 21, 2017
Speech Recognition and Synthesis参考文献 25被引用数 11
ひとこと要約

本稿では、共通の双方向LSTMエンコーダーを用いて、接続主義的時系列分類(CTC)モデルとセグメンタル条件付きランダムフィールド(SCRF)モデルを同時に学習するマルチタスク学習フレームワークを提案する。TIMITデータセット上でエンド・トゥ・エンド学習中にCTCとSCRFの損失関数を補間することで、両モデルの認識精度が向上し、CTCの事前学習により共同モデルの収束が加速される。

ABSTRACT

Segmental conditional random fields (SCRFs) and connectionist temporal classification (CTC) are two sequence labeling methods used for end-to-end training of speech recognition models. Both models define a transcription probability by marginalizing decisions about latent segmentation alternatives to derive a sequence probability: the former uses a globally normalized joint model of segment labels and durations, and the latter classifies each frame as either an output symbol or a "continuation" of the previous label. In this paper, we train a recognition model by optimizing an interpolation between the SCRF and CTC losses, where the same recurrent neural network (RNN) encoder is used for feature extraction for both outputs. We find that this multitask objective improves recognition accuracy when decoding with either the SCRF or CTC models. Additionally, we show that CTC can also be used to pretrain the RNN encoder, which improves the convergence rate when learning the joint model.

研究の動機と目的

  • エンド・トゥ・エンド音声認識精度を、マルチタスク学習によるCTCとSCRFの統合によって向上させること。
  • 個々のモデルと比較して、損失関数の補間を用いた共同学習が一般化性能およびロバスト性を向上させるかどうかを調査すること。
  • 共有RNNエンコーダーに対するCTCの事前学習が、共同SCRF-CTCモデルの収束速度を向上させる有効性を検討すること。
  • 共同モデルと個々のCTCおよびSCRFシステムとの間で、計算効率および学習ダイナミクスを評価すること。

提案手法

  • 共通の双方向LSTMエンコーダーが、入力音声フレームからアコースティック特徴を抽出する。
  • 同じエンコーダーがCTCヘッドおよびSCRFヘッドの両方の出力を生成し、共同最適化を可能にする。
  • 損失関数は、CTC損失(フレームレベル、交差エントロピー)とSCRF損失(シーケンスレベル、グローバルに正規化)の補間である。
  • 共同学習の目的関数は、フレームレベルのCTCの教師信号と、シーケンスレベルのSCRFの判別的学習を統合する。
  • 共同学習の前段階としてCTC事前学習を実施し、エンコーダーの初期化を図ることで収束速度を向上させる。
  • 学習率の減少とドロップアウト正則化(率0.2)を用いた確率的勾配降下法で学習を実行する。

実験結果

リサーチクエスチョン

  • RQ1マルチタスク学習によるCTCとSCRFの共同学習は、個別モデルと比較して認識精度を向上させることができるか?
  • RQ2CTCとSCRFの損失関数の補間は、一般化性能を向上させる正則化効果をもたらすか?
  • RQ3共有RNNエンコーダーに対するCTC事前学習は、共同SCRF-CTCモデルの収束を加速させることができるか?
  • RQ4共同モデルの計算コストは、個別CTCおよびSCRFシステムと比較してどの程度か?
  • RQ5マルチタスク学習による改善効果は、入力特徴の種別(例:FBANK対fMLLR)に依存するか?

主な発見

  • fMLLR特徴を用いた場合、TIMIT開発セットにおける音素誤り率(PER)は、SRNNの16.6%およびCTCの16.7%から、それぞれ15.9%および16.2%に低下した。
  • FBANK特徴を用いた場合、PERはSRNNの18.1%およびCTCの17.7%から、それぞれ17.5%および17.2%に改善された。
  • CTC事前学習戦略により、共同モデルの収束が顕著に高速化されたことが、学習曲線から明らかになった。
  • 共同モデルは、最良パスデコードによる性能でCTCレベルの性能を達成しており、先行研究(例:Gravesら、2013年)におけるビームサーチデコードの結果を同等以上に上回った。
  • 同じエンコーダーを用いた場合、CTCモデルはSCRFモデルの3~4倍速く、共同モデルは単体SCRFモデルよりもわずかに高コストであった。
  • マルチタスク学習による改善効果は、FBANK特徴の場合の方がfMLLR特徴の場合よりも顕著であり、利得に特徴依存性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。