Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Domain Adaptation Schemes for Building ASR in Low-resource Languages

C. S. Anoop, Prathosh AP|arXiv (Cornell University)|Sep 12, 2021
Speech Recognition and Synthesis参考文献 20被引用 5
一句话总结

本论文提出使用梯度反传层(GRL)和领域分离网络(DSN)的无监督域自适应(UDA)方法,通过共享声学空间利用高资源语言来提升低资源语言的自动语音识别(ASR)性能。当仅使用5.5小时未转录的梵语数据进行训练,并从印地语微调时,DSN相较于基线DNN将词错误率(WER)绝对降低7.32%,在无目标语言转录数据的情况下实现了显著提升。

ABSTRACT

Building an automatic speech recognition (ASR) system from scratch requires a large amount of annotated speech data, which is difficult to collect in many languages. However, there are cases where the low-resource language shares a common acoustic space with a high-resource language having enough annotated data to build an ASR. In such cases, we show that the domain-independent acoustic models learned from the high-resource language through unsupervised domain adaptation (UDA) schemes can enhance the performance of the ASR in the low-resource language. We use the specific example of Hindi in the source domain and Sanskrit in the target domain. We explore two architectures: i) domain adversarial training using gradient reversal layer (GRL) and ii) domain separation networks (DSN). The GRL and DSN architectures give absolute improvements of 6.71% and 7.32%, respectively, in word error rate over the baseline deep neural network model when trained on just 5.5 hours of data in the target domain. We also show that choosing a proper language (Telugu) in the source domain can bring further improvement. The results suggest that UDA schemes can be helpful in the development of ASR systems for low-resource languages, mitigating the hassle of collecting large amounts of annotated speech data.

研究动机与目标

  • 解决在缺乏大规模转录语音数据的低资源语言中构建高效ASR系统的挑战。
  • 探究无监督域自适应(UDA)是否能将高资源语言的知识迁移到共享语音音素空间的低资源语言。
  • 评估GRL和DSN架构在减少高资源语言(印地语)与低资源语言(梵语)分布之间域偏移方面的有效性。
  • 探索选择语言上更接近的源语言(泰卢固语)是否能进一步提升目标语言(梵语)的ASR性能。

提出的方法

  • 利用带有梯度反传层(GRL)的领域对抗训练,学习印地语(源)和梵语(目标)语音分布之间的领域不变特征。
  • 采用领域分离网络(DSN)将特征分解为共享和私有成分,促进领域不变表示学习。
  • 仅使用5.5小时未转录的目标语言(梵语)数据和大规模转录的源语言(印地语或泰卢固语)数据进行模型训练,目标语言无任何转录数据。
  • 通过t-SNE可视化和帧级领域分类准确率评估所学特征的领域不变性。
  • 在DSN中使用多组件损失函数,包括重建损失(MSE)、相似性损失和差异损失,以解耦领域特定和共享表示。
  • 通过词错误率(WER)比较基线DNN、多任务学习(MT)、GRL和DSN模型在梵语测试集上的性能。

实验结果

研究问题

  • RQ1当仅使用5.5小时未转录数据进行训练时,无监督域自适应(UDA)是否能显著提升梵语等低资源语言的ASR性能?
  • RQ2GRL和DSN架构在学习印地语(高资源)与梵语(低资源)语言之间的领域不变特征方面有多有效?
  • RQ3与使用印地语相比,选择语言上更接近的源语言(泰卢固语)是否能带来更好的梵语ASR性能?
  • RQ4所学特征在多大程度上表现出领域独立性,通过在源和目标数据集上的领域分类准确率衡量?
  • RQ5DSN损失函数的各个组成部分(重建、相似性、差异)对整体模型性能的贡献如何?

主要发现

  • 当仅使用5.5小时未转录的梵语数据进行微调时,DSN模型相较于基线DNN将词错误率(WER)绝对降低7.32%。
  • 在相同低资源设置下,GRL模型相较于基线DNN将WER绝对降低6.71%。
  • 当使用泰卢固语作为源域而非印地语时,DSN模型在梵语测试集上的WER为13.72%,相较于从印地语迁移的性能提升了3.5%–4.5%。
  • UDA模型中的帧级领域准确率显著下降(例如,DSN在梵语测试集上的准确率为63.21%),证实所学特征相较于多任务学习(准确率为91.86%)更具领域不变性。
  • 当DSN中缺失相似性损失(β = 0)时,WER上升3.11%(至20.37%),表明其在解耦私有与共享特征方面具有关键作用。
  • 在DSN中使用SIMSE替代MSE作为重建损失时,WER增加0.90%(18.00% vs. 17.26%),表明MSE在重建任务中更有效。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。