[论文解读] Transfer learning from High-Resource to Low-Resource Language Improves Speech Affect Recognition Classification Accuracy
本文提出了一种迁移学习方法,利用高资源语言数据(IEMOCAP、EMOVO)来提升低资源语言(乌尔都语、意大利语)中的语音情感识别性能,分别取得了69.32%和68.52%的UAR得分。通过在目标语言数据上微调带有注意力机制的预训练编码器-解码器模型,该方法显著优于基线模型和跨语料库设置,表明同时迁移编码器和注意力参数对成功至关重要。
Speech Affect Recognition is a problem of extracting emotional affects from audio data. Low resource languages corpora are rear and affect recognition is a difficult task in cross-corpus settings. We present an approach in which the model is trained on high resource language and fine-tune to recognize affects in low resource language. We train the model in same corpus setting on SAVEE, EMOVO, Urdu, and IEMOCAP by achieving baseline accuracy of 60.45, 68.05, 80.34, and 56.58 percent respectively. For capturing the diversity of affects in languages cross-corpus evaluations are discussed in detail. We find that accuracy improves by adding the domain target data into the training data. Finally, we show that performance is improved for low resource language speech affect recognition by achieving the UAR OF 69.32 and 68.2 for Urdu and Italian speech affects.
研究动机与目标
- 解决低资源语言在语音情感识别中因标注数据有限带来的挑战。
- 探究从高资源语言向低资源语言迁移学习是否能提升分类准确率。
- 评估在多个语料库上联合训练对跨语言情感识别泛化能力的影响。
- 确定在成功迁移中,模型组件(编码器、解码器、注意力)的哪一部分最为关键。
提出的方法
- 采用带有注意力机制的序列到序列编码器-解码器模型,实现端到端的语音情感识别。
- 在高资源语料库(IEMOCAP和EMOVO)上预训练模型,以学习通用的情感模式。
- 使用预训练模型对低资源语言数据(乌尔都语和意大利语)进行微调,同时在训练过程中加入领域特定数据。
- 通过使用源语言模型的编码器和注意力权重初始化目标语言模型,实现迁移学习。
- 采用三重交叉验证评估模型在不同语料库间的泛化能力。
- 使用未加权平均召回率(UAR)作为主要指标,以应对情感语音数据集中类别不平衡的问题。
实验结果
研究问题
- RQ1从高资源语言向低资源语言迁移学习是否能提升语音情感识别的准确率?
- RQ2在多个语料库上联合训练如何影响模型在不同语言和情感类别上的泛化能力?
- RQ3预训练模型中的哪些组件(编码器、解码器、注意力)在低资源设置下的迁移中最为有效?
- RQ4在微调过程中添加领域特定的目标语言数据是否能提升性能?
主要发现
- 该迁移学习方法在乌尔都语上取得了69.32%的UAR,在意大利语上取得了68.52%的UAR,显著优于基线模型和跨语料库设置。
- 在IEMOCAP上训练并在乌尔都语上微调的模型,在乌尔都语上达到了69.32%的UAR,证明了向低资源语言有效迁移知识的能力。
- 在训练过程中加入领域特定的目标语言数据提升了分类准确率,凸显了领域内微调的重要性。
- 同时迁移编码器和注意力参数对性能提升至关重要;仅迁移解码器参数则未带来显著改进。
- 在跨语料库评估中,该模型优于现有方法,尤其是在高资源语料库上训练并在低资源语料库上测试时表现更优。
- 结果表明,在某些迁移设置下,乌尔都语和意大利语等低资源语言的准确率甚至高于高资源英语,表明迁移学习具有缓解数据稀缺问题的潜力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。