[论文解读] Dynamic Restrained Uncertainty Weighting Loss for Multitask Learning of Vocal Expression
本文提出动态受限不确定性加权(DRUW),一种新颖的损失加权策略,结合不确定性加权与动态加权平均,用于多任务学习中语音表达识别的多任务平衡。通过引入约束项控制任务权重之和,DRUW 提升了训练稳定性和可解释性,在 ICML ExVo 2022 挑战赛中取得 0.394 的测试 H-Mean 得分,显著优于基线的 0.335。
We propose a novel Dynamic Restrained Uncertainty Weighting Loss to experimentally handle the problem of balancing the contributions of multiple tasks on the ICML ExVo 2022 Challenge. The multitask aims to recognize expressed emotions and demographic traits from vocal bursts jointly. Our strategy combines the advantages of Uncertainty Weight and Dynamic Weight Average, by extending weights with a restraint term to make the learning process more explainable. We use a lightweight multi-exit CNN architecture to implement our proposed loss approach. The experimental H-Mean score (0.394) shows a substantial improvement over the baseline H-Mean score (0.335).
研究动机与目标
- 为解决多任务学习(MTL)中语音表达识别任务间难度不平衡导致性能下降的问题。
- 通过基于任务不确定性和梯度动态的损失权重动态调整,提升模型泛化能力和训练稳定性。
- 通过引入约束项控制权重总和至灵活的目标值,增强损失加权机制的可解释性。
- 设计一种轻量级多输出卷积神经网络(CNN)架构,实现在网络不同深度进行任务特定的特征提取。
- 通过结合不确定性加权与动态加权平均的优势,在 ICML ExVo 2022 挑战赛中实现更优性能。
提出的方法
- 提出一种包含五个分层 CNN 模块的多输出 CNN 架构,支持从不同网络深度进行早期和晚期预测,以捕捉多样化的特征表示。
- 引入动态受限不确定性加权(DRUW)损失,通过在不确定性加权(UW)基础上增加约束项,将对数权重之和控制在灵活的目标值 φ。
- 结合 UW 的基于不确定性的损失加权与 DWA 的动态权重适应机制,利用近期损失的指数移动平均实现自适应调整。
- 联合损失函数包括:(1) 不确定性加权的任务损失,(2) 惩罚极端权重值的正则化项,以及 (3) 强制绝对对数权重之和接近 φ 的约束项。
- 采用灵活的归一化方案,权重总和不固定为 1(如 Softmax 所做),而是允许趋近于 φ,从而实现在不同任务间的自适应平衡。
- 使用 2.5 秒音频片段的梅尔频谱图特征(64×512),采用 AdamW 优化器,初始初始值为 0.001,批量大小为 32,在 RTX 3090 和 A40 GPU 上训练 60 个周期。
实验结果
研究问题
- RQ1结合基于不确定性的加权与动态加权的混合损失加权策略,能否提升语音表达识别中多任务学习的性能?
- RQ2引入控制损失权重总和的约束项,是否能增强训练稳定性与模型可解释性?
- RQ3所提出的 DRUW 损失与基线策略(如等权重、不确定性加权、动态加权平均)相比,在多任务平衡方面表现如何?
- RQ4多输出 CNN 架构在多任务语音表达分析中,对多样化任务的特征表示学习提升程度如何?
- RQ5DRUW 损失是否在 ICML ExVo 2022 挑战赛中相比现有 MTL 基线展现出更优的泛化能力与鲁棒性?
主要发现
- 所提出的 DRUW 损失在 ExVo 2022 挑战赛中取得 0.394 的测试 H-Mean 得分,显著优于基线的 0.335。
- 采用 DRUW 损失的多输出 CNN 模型在验证集上达到 0.423 的 H-Mean,测试集上达到 0.394,展现出强大的泛化能力与鲁棒性。
- 与其他损失策略相比,DRUW 在性能上优于不确定性加权(UW)、正则化不确定性加权(RUW)与动态加权平均(DWA),表明其在平衡任务贡献方面的有效性。
- DRUW 中的约束组件有助于实现更稳定且可解释的权重自适应,防止在简单任务上过拟合,同时提升困难任务的性能。
- 即使未使用数据增强或集成方法,该模型仍达到最先进性能,凸显所提架构与损失函数的高效性与有效性。
- 结果证实,在受限权重总和下结合基于不确定性的加权与动态适应,可显著提升语音表达识别中多任务学习的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。