Skip to main content
QUICK REVIEW

[论文解读] Learning not to Discriminate: Task Agnostic Learning for Improving Monolingual and Code-switched Speech Recognition

Gurunath Reddy Madhumani, Sanket Shah|arXiv (Cornell University)|Jun 9, 2020
Speech Recognition and Synthesis参考文献 13被引用 5
一句话总结

本文提出一种无需任务依赖的训练方法,通过领域对抗训练同时提升单语和代码切换语音识别的性能。通过对抗判别器使共享层对任务身份(单语 vs. 代码切换)保持不变,模型学习到在两种任务间通用的共享特征,从而在三个语种对的测试集上,单语语音识别的WER最高降低3.1%,代码切换语音识别的WER最高降低2.2%。

ABSTRACT

Recognizing code-switched speech is challenging for Automatic Speech Recognition (ASR) for a variety of reasons, including the lack of code-switched training data. Recently, we showed that monolingual ASR systems fine-tuned on code-switched data deteriorate in performance on monolingual speech recognition, which is not desirable as ASR systems deployed in multilingual scenarios should recognize both monolingual and code-switched speech with high accuracy. Our experiments indicated that this loss in performance could be mitigated by using certain strategies for fine-tuning and regularization, leading to improvements in both monolingual and code-switched ASR. In this work, we present further improvements over our previous work by using domain adversarial learning to train task agnostic models. We evaluate the classification accuracy of an adversarial discriminator and show that it can learn shared layer parameters that are task agnostic. We train end-to-end ASR systems starting with a pooled model that uses monolingual and code-switched data along with the adversarial discriminator. Our proposed technique leads to reductions in Word Error Rates (WER) in monolingual and code-switched test sets across three language pairs.

研究动机与目标

  • 解决在代码切换数据上微调时单语语音识别性能下降的问题。
  • 学习对任务身份(单语 vs. 代码切换)不变的共享声学表征,同时不损失任务特定的判别能力。
  • 通过对抗训练提升单语和代码切换语音识别的联合性能。
  • 验证任务无关的共享层相比标准微调或正则化策略是否能带来更好的泛化能力。
  • 探索在对抗共享层之后引入任务特定层以进一步提升性能。

提出的方法

  • 使用池化后的单语和代码切换数据联合训练端到端语音识别模型,包含共享层和任务特定的输出头。
  • 在对抗判别器中引入梯度反传层(GRL),以最小化共享层特征对单语与代码切换身份的分类准确率。
  • 通过联合损失函数优化模型:包括单语语音识别损失、代码切换语音识别损失和对抗损失,以促进任务无关的共享特征学习。
  • 使用多任务对抗判别器,基于共享层特征将语音样本分类为单语或代码切换。
  • 通过随机梯度下降更新模型参数,分别处理单语、代码切换和对抗目标的损失分量。
  • 通过在三个语种对的单语和代码切换测试集上计算词错误率(WER)来评估性能。

实验结果

研究问题

  • RQ1能否利用对抗训练学习到任务无关的共享表征,从而同时提升单语和代码切换语音识别的性能?
  • RQ2在共享层之后加入任务特定层是否能进一步提升性能,超越仅使用对抗训练的效果?
  • RQ3当使用对抗判别器训练时,共享层能否学习到不变特征,而非使用标准分类器?
  • RQ4与以往的微调和正则化策略相比,该方法在单语和代码切换测试集上的WER表现如何?
  • RQ5任务无关的共享层对多语言、代码切换场景下的模型泛化能力有何影响?

主要发现

  • 多任务对抗模型(实验6,Exp6)在所有测试集上达到最低WER,相比池化模型(Exp3)在泰米尔语-英语单语测试集上降低3.1%,在代码切换测试集上降低2.2%。
  • 对抗任务无关池化模型(Exp5)相比最佳微调模型(Exp4),在泰米尔语-英语单语测试集上WER降低1.21%,在代码切换测试集上降低1.28%。
  • 分类实验表明,对抗判别器的验证准确率保持在约50%,表明共享层学习到了任务无关特征;而普通分类器的准确率持续上升,表明其学习到了任务特定特征。
  • 在所有三个语种对(泰米尔语-英语、泰卢固语-英语、古吉拉特语-英语)中,加入任务特定层与对抗训练的模型表现最佳。
  • WER降低效果在所有语种对中保持一致,其中泰米尔语-英语的绝对提升最大(单语提升3.1%,代码切换提升2.2%)。
  • 结果证实,任务无关的共享层对于在提升代码切换识别性能的同时保持单语语音识别性能至关重要。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。