Skip to main content
QUICK REVIEW

[論文レビュー] Domain Adversarial Training for Accented Speech Recognition

Sining Sun, Ching-Feng Yeh|arXiv (Cornell University)|Jun 7, 2018
Speech Recognition and Synthesis参考文献 11被引用数 15
ひとこと要約

本稿では、発音データのトランスクリプションを必要とせずに発音特徴を発音に依存しないものに学習するドメイン adversarial training (DAT) を提案する。標準発音と発音の違いを最小化するようにTDNN音声モデルを訓練する際、ドメイン分類器を adversarial に使用することで、中国語発音において最大7.45%の相対的文字誤り率削減を達成した。これはマルチタスク学習を上回り、自動トランスクリプションと組み合わせても効果を発揮した。

ABSTRACT

In this paper, we propose a domain adversarial training (DAT) algorithm to alleviate the accented speech recognition problem. In order to reduce the mismatch between labeled source domain data ("standard" accent) and unlabeled target domain data (with heavy accents), we augment the learning objective for a Kaldi TDNN network with a domain adversarial training (DAT) objective to encourage the model to learn accent-invariant features. In experiments with three Mandarin accents, we show that DAT yields up to 7.45% relative character error rate reduction when we do not have transcriptions of the accented speech, compared with the baseline trained on standard accent data only. We also find a benefit from DAT when used in combination with training from automatic transcriptions on the accented data. Furthermore, we find that DAT is superior to multi-task learning for accented speech recognition.

研究の動機と目的

  • 少ないトランスクリプション付きデータによる低リソース発音認識の課題に対処すること。
  • エンドツーエンドのASRシステムにおける標準発音と発音の間のドメイン不一致を軽減すること。
  • 大量のラベルなし発音データを活用する非教師付き適応手法を開発すること。
  • 低リソース環境下でDATをマルチタスク学習および教師あり適応と比較すること。
  • さまざまな発音の重症度を持つ複数の中国語発音でDATの有効性を評価すること。

提案手法

  • 標準発音と発音を区別できるドメイン分類器をKaldiベースのTDNN音声モデルに追加する。
  • 標準ASR損失(CEおよびMMI)とドメイン adversarial 損失の組み合わせを用いてモデルを訓練する。
  • 勾配反転を用いてドメイン分類器から共有特徴抽出器へ adversarial 信号を逆伝播させ、ドメイン不変表現を促進する。
  • 共有ネットワークからの特徴表現を用いて、ドメイン分類器を発音タイプ(標準対発音)を予測するように訓練する。
  • 600時間のラベルなし中国語発音データを用いて、マルチ発音および発音特化適応設定の両方で手法を適用する。
  • ASRとドメイン adversarial 目的の間のトレードオフに最適なハイパーパrameterとしてλ = 0.03を用いる。

実験結果

リサーチクエスチョン

  • RQ1トランスクリプションのない発音データを用いても、ドメイン adversarial training は発音認識の文字誤り率を低減できるか?
  • RQ2標準ASRモデルを発音認識に適応させる際、マルチタスク学習と比較してDATはどのように性能を発揮するか?
  • RQ3発音認識の自動トランスクリプションと組み合わせた場合、DATの影響は何か?
  • RQ4発音特化適応においてDATを用いることで、マルチ発音適応よりも高い性能が得られるか?
  • RQ5さまざまな中国語発音(発音の重症度が異なる)において、DATの性能はどのように変化するか?

主な発見

  • 発音データのトランスクリプションが存在しない状況で、DATは中国語発音において最大7.45%の相対的文字誤り率削減を達成した。
  • 発音特化適応では、標準モデルと比較してSC、HN、FJ発音でそれぞれ5.8%、7.4%、3.1%のCER削減を達成した。
  • DATは一貫してマルチタスク学習を上回り、発音特徴を識別する学習が原因で性能が低下する場合もあった。
  • 自動トランスクリプションと組み合わせた場合、DATは全体で20%のCER削減を追加的に達成し、相乗効果があることを示した。
  • 人間によるトランスクリプションが利用可能な場合、DATの性能向上は小さくなったため、主に非教師付き適応の価値が顕著であることが示された。
  • 最適なトレードオフハイパーパrameter λ は 0.03 であり、ASRの正確性とドメイン不変性の両立に適していることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。