[论文解读] Redundancy Reduction Twins Network: A Training framework for Multi-output Emotion Regression
本文提出冗余减少孪生网络(RRTN),一种通过最小化同一样本不同增强视图间嵌入的互相关性来减少多输出情感回归中特征冗余的训练框架,采用Barlow Twins损失和一种新颖的受限不确定性加权损失(RUWL)实现动态损失平衡。该方法在ExVo开发集上将原始CNN14的组内一致性相关系数(CCC)提升至0.678,相对提升4.8%。
In this paper, we propose the Redundancy Reduction Twins Network (RRTN), a redundancy reduction training framework that minimizes redundancy by measuring the cross-correlation matrix between the outputs of the same network fed with distorted versions of a sample and bringing it as close to the identity matrix as possible. RRTN also applies a new loss function, the Barlow Twins loss function, to help maximize the similarity of representations obtained from different distorted versions of a sample. However, as the distribution of losses can cause performance fluctuations in the network, we also propose the use of a Restrained Uncertainty Weight Loss (RUWL) or joint training to identify the best weights for the loss function. Our best approach on CNN14 with the proposed methodology obtains a CCC over emotion regression of 0.678 on the ExVo Multi-task dev set, a 4.8% increase over a vanilla CNN 14 CCC of 0.647, which achieves a significant difference at the 95% confidence interval (2-tailed).
研究动机与目标
- 解决多输出情感回归模型中的特征冗余问题,以提升泛化能力与性能。
- 开发一种利用数据增强提升表征学习的训练框架,且不增加模型复杂度。
- 提出一种新颖的损失加权策略,以在多损失设置中稳定训练并提升收敛性。
- 在大规模语音爆发情感数据集(Hume-VB)上验证冗余减少与联合损失优化的有效性。
提出的方法
- 通过SpecAugment进行数据增强,为每个输入样本生成两个失真视图。
- 将原始样本与增强样本输入相同的编码器,生成用于回归的表征和用于对比学习的嵌入。
- 最小化嵌入之间的互相关矩阵,使其尽可能接近单位矩阵,从而减少冗余。
- 使用Barlow Twins损失函数,最大化同一样本在不同增强下嵌入的相似性。
- 实施一种受限不确定性加权损失(RUWL)策略,动态调整损失权重,同时约束其总和以保持稳定性。
- 使用Barlow Twins损失与情感回归损失的加权和训练网络,其中RUWL优化两者之间的权衡。
实验结果
研究问题
- RQ1学习表征中的冗余减少是否能提升多输出情感回归任务的性能?
- RQ2在基于音频的情感回归中应用Barlow Twins损失时,其在减少冗余方面的有效性如何?
- RQ3通过RUWL实现的动态损失加权是否相比固定或未加权的损失组合,能带来更稳定且更优的训练?
- RQ4RRTN框架在不同主干网络架构(尤其是CNN14等深层网络)上的表现如何?
- RQ5所提出的框架在ExVo多任务情感回归基准上相比标准训练基线,优势有多大?
主要发现
- RRTN框架在使用CNN14时,于ExVo多任务开发集上实现了0.678的组内一致性相关系数(CCC),相比原始CNN14基线(0.647)实现了4.8%的相对提升。
- 该提升在95%置信区间内具有统计显著性,证实了冗余减少方法的有效性。
- RRTN框架在不同主干模型上均一致提升了性能,其中CNN14的增益最大(4.8%),而CNN10的增益为2%,这归因于其更深的架构。
- 相较于标准RRTN训练,RUWL损失策略带来了微小但一致的性能提升,表明动态损失加权可增强训练稳定性与性能。
- 互相关性最小化策略是性能提升的主要驱动力,而损失加权机制则起到了次要但有益的作用。
- 该方法引入的参数开销极小,仅增加了一个线性投影层,使其成为一种轻量化但高效的训练框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。