Skip to main content
QUICK REVIEW

[論文レビュー] Learning not to Discriminate: Task Agnostic Learning for Improving Monolingual and Code-switched Speech Recognition

Gurunath Reddy Madhumani, Sanket Shah|arXiv (Cornell University)|Jun 9, 2020
Speech Recognition and Synthesis参考文献 13被引用数 5
ひとこと要約

本論文は、ドメイン適応的訓練を用いたタスクに依存しない学習アプローチを提案し、同時に単語話言語およびコードスイッチド音声認識を改善する。共有層をタスクの種別(単語話言語対コードスイッチド)に対して不変に保つために敵対的ディスクラミネーターを用いることで、両タスクに一般化可能な共有特徴を学習し、3つの言語対において、単語話言語テストセットで最大3.1%、コードスイッチドテストセットで最大2.2%のWER低減を達成した。

ABSTRACT

Recognizing code-switched speech is challenging for Automatic Speech Recognition (ASR) for a variety of reasons, including the lack of code-switched training data. Recently, we showed that monolingual ASR systems fine-tuned on code-switched data deteriorate in performance on monolingual speech recognition, which is not desirable as ASR systems deployed in multilingual scenarios should recognize both monolingual and code-switched speech with high accuracy. Our experiments indicated that this loss in performance could be mitigated by using certain strategies for fine-tuning and regularization, leading to improvements in both monolingual and code-switched ASR. In this work, we present further improvements over our previous work by using domain adversarial learning to train task agnostic models. We evaluate the classification accuracy of an adversarial discriminator and show that it can learn shared layer parameters that are task agnostic. We train end-to-end ASR systems starting with a pooled model that uses monolingual and code-switched data along with the adversarial discriminator. Our proposed technique leads to reductions in Word Error Rates (WER) in monolingual and code-switched test sets across three language pairs.

研究の動機と目的

  • コードスイッチドデータでのファインチューニングによって単語話言語ASR性能が低下する問題に対処すること。
  • タスクの種別(単語話言語対コードスイッチド)に対して不変な共有音声表現を学習し、タスク固有の識別性を損なわずに、両タスクに一般化可能な特徴を学習すること。
  • 敵対的訓練を用いて、単語話言語およびコードスイッチド音声認識の両方の性能を向上させること。
  • 標準的なファインチューニングや正則化手法と比較して、タスクに依存しない共有層が一般化性能を向上させるかどうかを検証すること。
  • タスク固有の層を敵対的共有層と統合することで、性能をさらに向上させることを検討すること。

提案手法

  • 共有層とタスク固有の出力ヘッドを用いて、プールされた単語話言語およびコードスイッチドデータでエンドツーエンドASRモデルを学習する。
  • 共有層特徴の単語話言語対コードスイッチド識別を最小化するため、敵対的ディスクラミネーターに勾配反転層(GRL)を導入する。
  • 単語話言語ASR損失、コードスイッチドASR損失、敵対的損失の3つを組み合わせたジョイント損失を最適化することで、タスクに依存しない共有特徴を促進する。
  • 共有層特徴に基づいて発話文を単語話言語またはコードスイッチドとして分類するマルチタスク敵対的ディスクラミネーターを用いる。
  • 単語話言語、コードスイッチド、敵対的目的のそれぞれに別個の損失成分を用いて、確率的勾配降下法でモデルパラメータを更新する。
  • 3つの言語対における単語話言語およびコードスイッチドテストセットの語誤り率(WER)を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1敵対的訓練を用いて、単語話言語およびコードスイッチド音声認識の両方の性能を向上させるタスクに依存しない共有表現を学習できるか?
  • RQ2共有層の後にタスク固有の層を追加することで、敵対的訓練のみに比べて性能がさらに向上するか?
  • RQ3標準的な分類器とは対照的に、敵対的ディスクラミネーターを用いて学習させた場合、共有層が不変な特徴を学習できるか?
  • RQ4本手法は、先行するファインチューニングおよび正則化戦略と比較して、単語話言語およびコードスイッチドテストセットにおけるWERの観点で優れているか?
  • RQ5タスクに依存しない共有層が、多言語およびコードスイッチングの文脈におけるモデルの一般化性能に与える影響は何か?

主な発見

  • マルチタスク敵対的モデル(Exp6)は、すべてのテストセットで最小のWERを達成し、プールドモデル(Exp3)と比較して、タミル-英語単語話言語で3.1%、タミル-英語コードスイッチドで2.2%の低減を達成した。
  • 敵対的タスクに依存しないプールドモデル(Exp5)は、最良のファインチューニングモデル(Exp4)と比較して、タミル-英語単語話言語で1.21%、タミル-英語コードスイッチドで1.28%のWER低減を達成した。
  • 分類実験の結果、敵対的ディスクラミネーターの検証精度は一定(約50%)を維持しており、共有層がタスク不変な特徴を学習していることが示された。一方、バニラ分類器の精度は上昇しており、タスク固有の特徴学習が行われていることが示された。
  • タスク固有の層と敵対的訓練を組み合わせたモデルは、3つの言語対(タミル-英語、テルグ-英語、グジャラート-英語)すべてで最高の性能を達成した。
  • WERの低減はすべての言語対で一貫しており、最大の絶対的改善はタミル-英語で観察された(単語話言語で3.1%、コードスイッチドで2.2%)。
  • 結果から、タスクに依存しない共有層が、単語話言語音声認識の性能を維持しながら、コードスイッチド認識を向上させるために不可欠であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。