Skip to main content
QUICK REVIEW

[论文解读] Effects of Layer Freezing on Transferring a Speech Recognition System to Under-resourced Languages

Onno Eberhard, Torsten Zesch|arXiv (Cornell University)|Feb 8, 2021
Speech Recognition and Synthesis被引用 4
一句话总结

本文研究了在低资源语言自动语音识别(ASR)中迁移学习的层冻结策略,采用Mozilla的DeepSpeech架构将预训练的英语模型迁移至德语和瑞士德语。与微调所有层相比,冻结前1至3层可显著降低词错误率(WER),且冻结层数超过三层后性能提升微乎其微,表明早期层在相关语言间学习到了可迁移的通用特征。

ABSTRACT

In this paper, we investigate the effect of layer freezing on the effectiveness of model transfer in the area of automatic speech recognition. We experiment with Mozilla's DeepSpeech architecture on German and Swiss German speech datasets and compare the results of either training from scratch vs. transferring a pre-trained model. We compare different layer freezing schemes and find that even freezing only one layer already significantly improves results.

研究动机与目标

  • 评估层冻结对低资源语言ASR中迁移学习效果的影响。
  • 确定将预训练的英语DeepSpeech模型适配至德语和瑞士德语时,最优的层冻结策略。
  • 评估深度网络中的分层特征学习是否支持在微调过程中冻结早期层。
  • 在有限资源数据集上,比较不同冻结方案在WER和CER指标上的性能表现。

提出的方法

  • 使用迁移学习在德语和瑞士德语数据集上微调一个预训练的英语DeepSpeech模型。
  • 应用多种层冻结方案:冻结0、1、2、3、4、5或1–5层(不包括最终输出层)。
  • 采用DeepSpeech架构,共6层:3个全连接(FC)层,1个LSTM层,以及2个最终的FC层,激活函数分别为ReLU和Softmax。
  • 使用Adam优化器,并采用连接时序分类(CTC)损失函数进行序列到序列对齐。
  • 使用WER和CER在保留的测试集上评估结果,语言模型采用KenLM在混合文本语料上训练。
  • 通过学习曲线和各训练轮次的指标评估收敛性和泛化能力。

实验结果

研究问题

  • RQ1在将预训练的英语模型迁移至德语和瑞士德语时,冻结不同数量的层如何影响ASR性能?
  • RQ2冻结早期层(学习低级特征)是否优于冻结后期层或微调所有层?
  • RQ3在低资源语音识别任务中,为最小化WER和CER,最优的冻结层数是多少?
  • RQ4不同冻结配置下的学习曲线和验证损失如何比较?
  • RQ5冻结更多层是否会导致收益递减甚至性能下降?

主要发现

  • 冻结前1至3层可获得最佳性能,德语WER从基线的70%降至44%,瑞士德语WER从74%降至67%。
  • 在德语上,冻结第1–2层的模型达到最低WER(44%)和CER(0.22),优于所有其他冻结方案。
  • 冻结超过三层(如1–5层)仅带来微小或无改善,某些情况下甚至出现轻微退化,表明收益递减。
  • 冻结四层或五层的模型仍表现强劲,表明英语预训练模型中的特征在相关语言间具有可迁移性。
  • 学习曲线显示,冻结早期层可实现更快收敛和更低的验证损失,且冻结1–3层与1–5层之间差异极小。
  • 冻结LSTM层(第4层)或最终全连接层(第5层)对性能影响不显著,表明这些层可能不像预期那样具有语言特异性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。