Skip to main content
QUICK REVIEW

[論文レビュー] Embedding-Based Speaker Adaptive Training of Deep Neural Networks

Xiaodong Cui, Vaibhava Goel|arXiv (Cornell University)|Oct 17, 2017
Speech Recognition and Synthesis参考文献 12被引用数 7
ひとこと要約

本稿では、スコアのiベクトルを用いて制御ネットワークを介して層固有の要素ごとのアフィン変換を生成し、深層ニューラルネットワーク音声モデル内の内部特徴表現を正規化する、埋め込みベースのスプーカー適応学習(SAT)手法を提案する。このアプローチは、メインネットワークと制御ネットワークを同時に最適化し、交差エントロピー学習下でSwitchboardで0.6%の絶対的WER改善、Callhomeで0.5%の改善を達成し、iベクトルベースのスプーカー認識学習を上回る性能を示した。

ABSTRACT

An embedding-based speaker adaptive training (SAT) approach is proposed and investigated in this paper for deep neural network acoustic modeling. In this approach, speaker embedding vectors, which are a constant given a particular speaker, are mapped through a control network to layer-dependent element-wise affine transformations to canonicalize the internal feature representations at the output of hidden layers of a main network. The control network for generating the speaker-dependent mappings is jointly estimated with the main network for the overall speaker adaptive acoustic modeling. Experiments on large vocabulary continuous speech recognition (LVCSR) tasks show that the proposed SAT scheme can yield superior performance over the widely-used speaker-aware training using i-vectors with speaker-adapted input features.

研究の動機と目的

  • 深層ニューラルネットワーク音声モデルにおけるスプーカー変動を扱うことで、共変量シフトを引き起こし、ASR性能を低下させる要因を軽減すること。
  • 隠れ層全体にわたる内部特徴表現を標準化することで、DNNにおけるスプーカー不変性を向上させること。
  • スプーカー埋め込みに基づくアフィン変換をメインネットワークの隠れ層に統合する共同学習フレームワークを開発すること。
  • iベクトルベースのスプーカー認識学習や入力特徴の適応といった既存手法を上回ること。
  • スプーカー埋め込みを用いて、細粒度で層固有の正規化変換を生成する可能性を検討すること。

提案手法

  • スプーカーの音声特性を表す固定長の埋め込みとして、スプーカーiベクトルが使用される。
  • 制御ネットワークは、各スプーカーのiベクトルを、要素ごとのスケーリング(a)およびバイアス(b)ベクトルにマッピングし、要素ごとのアフィン変換を生成する。
  • アフィン変換は、特定の隠れ層の出力に適用される:ŝ = a ⊙ x ⊕ b、ここで⊙および⊕は要素ごとの演算を表す。
  • 制御ネットワークとメインDNNを共同で学習させ、音声モデリングの目的関数を最適化することで、エンドツーエンドの適応が可能になる。
  • この手法は、メインネットワークアーキテクチャの下位3つのLSTM層の各出力後に正規化を適用する。
  • 本手法は、交差エントロピーおよび逐次学習基準を用いて、BabelおよびSwitchboard LVCSRデータセットで評価された。

実験結果

リサーチクエスチョン

  • RQ1スプーカー埋め込みに基づくアフィン変換により、内部特徴空間を標準化することで、DNN音声モデルの性能向上が達成できるか?
  • RQ2スプーカー適応入力特徴を用いたiベクトルベースのスプーカー認識学習と比較して、埋め込みベースのSATはどのように性能を発揮するか?
  • RQ3制御ネットワークとメインネットワークを同時に最適化することで、別個の適応よりも優れたスプーカー不変性が得られるか?
  • RQ4交差エントロピーと最小ベイズリスク(sMBR)といった異なる学習基準に対しても、本手法は汎用性を示せるか?
  • RQ5入力層や出力層のみにではなく、複数の隠れ層にSATを適用することで、性能にどのような影響があるか?

主な発見

  • 提案手法の埋め込みベースSATは、交差エントロピー学習下でSwitchboardで0.6%の絶対的WER低減(8.1%から7.5%に)を達成した。
  • Callhomeでは、交差エントロピー学習下で0.5%の絶対的WER低減(13.5%から13.0%に)を達成した。
  • sMBRを用いた逐次学習後、Switchboardでは0.1%の絶対的WER低減(7.2%から7.1%に)、Callhomeでは0.2%の低減(12.7%から12.5%に)を達成した。
  • 交差エントロピーと逐次学習の両方で性能向上が一貫しており、学習目的関数に対して頑健であることが示された。
  • 入力特徴のスプーカー適応を施したiベクトルベースのスプーカー認識学習を上回り、内部特徴空間の正規化の利点が実証された。
  • 制御ネットワークは、スプーカーに依存する変換を適切に学習し、スプーカー間での一般化性能を向上させた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。