Skip to main content
QUICK REVIEW

[論文レビュー] Adversarial Training for Multilingual Acoustic Modeling

Kevin Hu, Haşim Sak|arXiv (Cornell University)|Jun 17, 2019
Speech Recognition and Synthesis参考文献 22被引用数 6
ひとこと要約

本稿では、共有LSTM層における言語に依存しない特徴の学習を通じて、多言語音声認識の性能を向上させるための敵対的訓練を提案する。ドメイン敵対的言語識別ヘッドを導入し、勾配を逆転させることで、共有特徴における言語特有の情報を低減する。7か国語で評価した結果、多言語モデルでは平均4%、単言語モデルでは10%のWER低減が達成された。

ABSTRACT

Multilingual training has been shown to improve acoustic modeling performance by sharing and transferring knowledge in modeling different languages. Knowledge sharing is usually achieved by using common lower-level layers for different languages in a deep neural network. Recently, the domain adversarial network was proposed to reduce domain mismatch of training data and learn domain-invariant features. It is thus worth exploring whether adversarial training can further promote knowledge sharing in multilingual models. In this work, we apply the domain adversarial network to encourage the shared layers of a multilingual model to learn language-invariant features. Bidirectional Long Short-Term Memory (LSTM) recurrent neural networks (RNN) are used as building blocks. We show that shared layers learned this way contain less language identification information and lead to better performance. In an automatic speech recognition task for seven languages, the resultant acoustic model improves the word error rate (WER) of the multilingual model by 4% relative on average, and the monolingual models by 10%.

研究の動機と目的

  • 共有特徴表現における言語特有のバイアスを低減することで、多言語音声認識モデルの性能を向上させること。
  • エンド・ツー・エンドのASRにおいて、ドメイン敵対的ネットワークが言語間の知識移出を向上させることを調査すること。
  • 双方向LSTMを用いた敵対的訓練が、言語に依存しない特徴を学習する有効性を評価すること。
  • 各言語ごとのファインチューニングが、敵対的および非敵対的多言語モデルに与える影響を検討すること。
  • 未知の言語への一般化性能および多様な言語グループにおける性能を評価すること。

提案手法

  • 多言語音声認識モデルは、すべての言語で共通の双方向LSTM層を用いて特徴抽出を行う。
  • 各言語は、音素状態分類のための別個の音声認識(AM)ヘッドを有する。
  • 共有層に、フレームレベルの言語ラベルを分類する言語識別(LID)ヘッドを追加する。
  • バックプロパゲーション中にLIDヘッドからの勾配を逆転させることで、共有層が言語に依存しない特徴を学習するよう促す。
  • 全言語のデータを統合して訓練し、共有層に対して敵対的訓練を適用する。
  • LIDヘッドは交差エントロピー損失で学習され、特徴抽出器はドメイン識別可能性を最小化するように最適化される。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練により、共有音声特徴における言語特有の情報が低減され、多言語ASRの性能が向上するか?
  • RQ2敵対的訓練は、多言語および単言語ASRの設定における語誤り率(WER)にどのように影響するか?
  • RQ3各言語ごとのファインチューニングは性能を向上させるか?また、敵対的訓練とどのように相互作用するか?
  • RQ4言語に依存しない表現は、単言語データでのファインチューニングに対してどれほど感受性を示すか?
  • RQ5敵対的訓練は、未観測の言語や同じ言語グループに属する言語へ一般化可能か?

主な発見

  • 敵対的訓練により、フレームレベルの言語識別精度が平均62.2%から48.8%に低下し、共有特徴に含まれる言語特有の情報が減少したことが示された。
  • 多言語モデルは、非敵対的多言語学習と比較して、平均で4%の相対的WER低減を達成した。
  • 敵対的多言語モデルを基に学習した単言語モデルは、非敵対的モデルと比較して10%の相対的WER低減を達成した。
  • 各言語ごとのファインチューニングにより、多言語モデルのWERは平均4.5%改善したが、敵対的モデルでは平均2.8%悪化した。
  • 敵対的モデルのファインチューニングは、大多数の言語で性能低下を引き起こした。これは、言語に依存しない表現が単言語ファインチューニングに対して感受性が高いことを示唆している。
  • 敵対的モデルの共有層は、音声認識に有用な発音情報は保持しつつ、言語特有の手がかりを最小限に抑えることができた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。