Skip to main content
QUICK REVIEW

[論文レビュー] Dynamic Layer Normalization for Adaptive Neural Acoustic Modeling in Speech Recognition

Taesup Kim, Inchul Song|arXiv (Cornell University)|Jul 19, 2017
Speech Recognition and Synthesis参考文献 22被引用数 12
ひとこと要約

本稿では、動的層正規化(DLN)を提案する。DLNは、入力音声系列に基づいて層正規化のスケーリングおよびシフトパラメータを動的に生成する、新たな適応型正規化手法であり、適応データや発話者IDを必要とせずに、発話者および環境の変動に適応可能なニューラル音声特徴抽出モデルを実現する。DLNはTED-LIUMコーパスにおいて、語誤り率を最大で相対的に10.7%改善し、固定モデルサイズで外部教師信号なしに効果的な適応を実現することを示した。

ABSTRACT

Layer normalization is a recently introduced technique for normalizing the activities of neurons in deep neural networks to improve the training speed and stability. In this paper, we introduce a new layer normalization technique called Dynamic Layer Normalization (DLN) for adaptive neural acoustic modeling in speech recognition. By dynamically generating the scaling and shifting parameters in layer normalization, DLN adapts neural acoustic models to the acoustic variability arising from various factors such as speakers, channel noises, and environments. Unlike other adaptive acoustic models, our proposed approach does not require additional adaptation data or speaker information such as i-vectors. Moreover, the model size is fixed as it dynamically generates adaptation parameters. We apply our proposed DLN to deep bidirectional LSTM acoustic models and evaluate them on two benchmark datasets for large vocabulary ASR experiments: WSJ and TED-LIUM release 2. The experimental results show that our DLN improves neural acoustic models in terms of transcription accuracy by dynamically adapting to various speakers and environments.

研究の動機と目的

  • ニューラル音声特徴抽出モデルを未観測の発話者や環境に適用した際の音声認識精度の低下を解消すること。
  • iベクトルのような発話者埋め込みを必要とせず、追加の適応データも不要な、パラメータ効率の良い適応手法を開発すること。
  • 入力に依存する動的適応を、固定サイズのモデル内で実現するために、オンザフライで正規化パラメータを生成する能力を学習すること。
  • 多様な音響状態下でも、大規模語彙音声認識における一般化性能を向上させること。

提案手法

  • 入力発話の要約特徴を用いて、全結合ニューラルネットワークが層正規化のスケーリングおよびシフトパラメータを生成する。
  • 発話の要約特徴は入力系列から得られ、各層の正規化パラメータを動的に制御するために用いられる。
  • パラメータ生成器を含む全モデルが、勾配降下法を用いてバックプロパゲーションにより共同学習される。
  • 層正規化の不変性を活用しつつ、動的パラメータ生成によって発話者および環境に依存する適応を導入する。
  • 発話者固有のパラメータを格納しないことで、モデル拡大を回避し、固定モデルサイズを維持する。
  • 本手法は、深層双方向LSTM音声特徴抽出モデルに適用され、WSJおよびTED-LIUMデータセットで評価された。

実験結果

リサーチクエスチョン

  • RQ1適応データを必要とせずに、発話者および環境の変動に応じて層正規化を動的に適応させることは可能か?
  • RQ2正規化パラメータの動的生成により、多様な発話者および環境下でニューラル音声特徴抽出モデルの一般化性能が向上するか?
  • RQ3本手法は、モデルサイズを増加させることなく、標準の層正規化やベースラインモデルよりも優れた性能を達成するか?
  • RQ4明示的な発話者ラベルなしに、入力系列からのみ発話者関連の表現を学習できるか?

主な発見

  • TED-LIUMリリース2データセットにおいて、DLNはベースラインモデルに対して語誤り率で相対的に10.7%の改善を達成した。
  • WSJコーパスにおいて、DLNは開発セットでフレーム誤り率を1.7%、テストセットで1.8%低減したが、語誤り率の改善はやや限定的であった。
  • t-SNE可視化により、最初の層からの発話要約特徴が、発話者IDに対応するクラスタを形成していることが示された。ただし、発話者ラベルは与えられていなかった。
  • 第3層の特徴はより散らばっており、高層層が発話者以外の要因(例:環境の変動)を捉えている可能性を示唆している。
  • より大きなベースラインモデル(層数が多い)は過学習が顕著に進行したが、DLNは動的適応により、増加した容量を効果的に活用した。
  • 本手法は、標準モデルと比較して、トレーニングの収束が速かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。