[论文解读] Transfer Learning based Speech Affect Recognition in Urdu
本论文提出一种基于深度残差网络(ResNet34)的迁移学习方法,以提升乌尔都语这一低资源语言的低资源语音情感识别(SAR)性能。通过在高资源英语和德语数据集(RAVDESS、SAVEE、Emo-DB)上进行预训练,并在仅400个乌尔都语语音片段上微调,该方法在乌尔都语上的未加权平均召回率(UAR)达到74.7%,显著优于基线模型,证明了预训练模型能够有效迁移关键声学特征,从而克服数据稀缺问题。
It has been established that Speech Affect Recognition for low resource languages is a difficult task. Here we present a Transfer learning based Speech Affect Recognition approach in which: we pre-train a model for high resource language affect recognition task and fine tune the parameters for low resource language using Deep Residual Network. Here we use standard four data sets to demonstrate that transfer learning can solve the problem of data scarcity for Affect Recognition task. We demonstrate that our approach is efficient by achieving 74.7 percent UAR on RAVDESS as source and Urdu data set as a target. Through an ablation study, we have identified that pre-trained model adds most of the features information, improvement in results and solves less data issues. Using this knowledge, we have also experimented on SAVEE and EMO-DB data set by setting Urdu as target language where only 400 utterances of data is available. This approach achieves high Unweighted Average Recall (UAR) when compared with existing algorithms.
研究动机与目标
- 为解决低资源语言语音情感识别(SAR)中数据稀缺的问题,特别是针对乌尔都语。
- 探究从高资源语言(英语、德语)迁移学习是否能提升低资源环境下的SAR性能。
- 评估预训练深度残差网络在跨语言间迁移判别性声学特征的有效性。
- 证明迁移学习可在仅使用极少目标语言数据的情况下实现高UAR,从而降低对大规模标注数据集的依赖。
提出的方法
- 所有实验均采用ResNet34架构作为主干模型,基于使用Librosa提取的梅尔频谱图进行训练。
- 基线模型在高资源数据集(英语使用RAVDESS,德语使用Emo-DB)上进行预训练,以学习通用的语音情感特征。
- 在迁移学习中,冻结预训练模型的早期层,并添加一个新的分类头,在低资源乌尔都语数据集上进行微调。
- 模型采用端到端训练方式,输出层为Softmax,用于预测多个情感类别(中性、愤怒、悲伤、快乐)的情感标签。
- 训练采用25的批量大小,80/20的训练-测试集划分,共100个周期,学习率固定,确保实验间优化的一致性。
- 使用未加权平均召回率(UAR)作为主要评估指标,以应对数据集中类别不平衡的问题。
实验结果
研究问题
- RQ1从高资源语言(英语、德语)进行迁移学习是否能显著提升低资源乌尔都语语音情感识别的性能?
- RQ2在低资源SAR设置下,于高资源语言上进行预训练如何影响特征学习与模型泛化能力?
- RQ3在仅提供400个语音样本的情况下,迁移学习在多大程度上减少了对数据的依赖?
- RQ4在低资源场景下,预训练模型是否比随机初始化或微调初始化带来更大的性能提升?
主要发现
- 当从在RAVDESS上预训练的英语模型微调时,所提出的迁移学习方法在乌尔都语数据上实现了74.7%的UAR,相比基线模型有显著提升。
- 当从德语(Emo-DB)迁移时,模型在乌尔都语上的UAR达到87.5%,证明了强大的跨语言迁移能力。
- 消融实验证实,预训练模型对性能提升贡献最大,尤其是在捕捉低层次声学特征方面。
- 即使目标数据极少,迁移学习仍使UAR提升了10–15个百分点,相比从零开始训练。
- 该方法在乌尔都语SAR任务中优于现有方法,尤其在低数据场景下表现更优,验证了其高效性与可扩展性。
- 结果表明,预训练模型能有效缓解说话人与信道差异的影响,提升跨语言设置下的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。