[论文解读] Adversarial-based neural networks for affect estimations in the wild
本文提出了一种对抗性神经网络框架,利用去噪自编码器生成器的潜在特征,以提升在真实场景(in-the-wild)中对情感效价和唤醒度的估计性能。通过将多模态判别器条件化于这些潜在特征,并引入音频模态,该模型在 SEWA 和 ABAW 挑战数据集上均取得了最先进(SOTA)的性能表现,表明使用解耦潜在表示的对抗性训练可增强情感计算模型的性能。
There is a growing interest in affective computing research nowadays given its crucial role in bridging humans with computers. This progress has been recently accelerated due to the emergence of bigger data. One recent advance in this field is the use of adversarial learning to improve model learning through augmented samples. However, the use of latent features, which is feasible through adversarial learning, is not largely explored, yet. This technique may also improve the performance of affective models, as analogously demonstrated in related fields, such as computer vision. To expand this analysis, in this work, we explore the use of latent features through our proposed adversarial-based networks for valence and arousal recognition in the wild. Specifically, our models operate by aggregating several modalities to our discriminator, which is further conditioned to the extracted latent features by the generator. Our experiments on the recently released SEWA dataset suggest the progressive improvements of our results. Finally, we show our competitive results on the Affective Behavior Analysis in-the-Wild (ABAW) challenge dataset
研究动机与目标
- 探索对抗性学习的潜在特征在真实场景(in-the-wild)视频数据中提升情感估计性能的可行性。
- 通过将判别器条件化于生成器提取的解耦潜在表示,提升多模态情感识别性能。
- 探究在连续情感估计任务中,使用潜在特征条件化的对抗性训练是否能提升性能。
- 在大规模真实场景数据集(如 SEWA 和 Aff-Wild2)上评估所提出方法的性能。
- 证明结合音频与视觉模态,并引入对抗性特征学习,可实现鲁棒的情感估计。
提出的方法
- 模型采用类似 Star-GAN 的架构,包含条件式判别器和基于自编码器的生成器(AEG),用于图像去噪和潜在特征提取。
- AEG 从噪声输入生成清晰图像,并提取鲁棒的潜在特征 z,用于条件化判别器。
- 条件式判别器(CD)接收视觉和音频输入,并以潜在特征 z 作为条件,用于估计样本的真实性(真实/伪造)以及效价/唤醒度水平。
- 在 AEG 与 CD 之间进行对抗性训练:AEG 最小化重建损失并欺骗 CD,而 CD 则最大化对真实与伪造样本的分类准确率。
- 在训练过程中,通过将音频嵌入与视觉特征在判别器中拼接,实现音频模态的聚合。
- 模型使用标准的 ℓ² 损失进行重建,使用对抗性损失进行分布匹配,并在潜在空间上采用渐进式训练策略。
实验结果
研究问题
- RQ1对抗性学习的潜在特征是否能提升真实场景视频数据中连续情感估计的性能?
- RQ2将判别器条件化于去噪自编码器提取的潜在表示,是否能增强效价与唤醒度预测的性能?
- RQ3在对抗性框架中,音频模态的引入如何影响多模态情感估计的性能?
- RQ4在真实场景情感识别基准上,使用潜在特征条件化的对抗性训练在多大程度上优于标准深度学习基线?
- RQ5所提出方法是否能在 SEWA 和 Aff-Wild2 等多样化数据集上实现泛化,并取得具有竞争力的结果?
主要发现
- 所提出的 AEG-CD-SZ 模型在 SEWA 数据集上的唤醒度估计中取得了 CCC = 0.430 的性能,优于基线(0.427)和最先进方法(0.392)。
- 在 ABAW 挑战数据集上,AEG-CD-SZ 模型在唤醒度估计中取得了 CCC = 0.26 的性能,优于基线(0.24),且在标准判别器基础上表现出持续改进。
- 同时引入潜在特征 z 和音频模态(AEG-CD-SZ)带来了最大的性能提升,尤其在唤醒度维度上,表明多模态与潜在条件化学习的重要性。
- 仅使用判别器的基线(Disc)在效价与唤醒度指标上均已优于 SEWA 基线,表明对抗性训练本身即可提升性能。
- AEG 的去噪能力通过视觉验证:生成图像相比原始输入显著减少了噪声,清晰度明显提升。
- 所有模型变体均表现出渐进式性能提升,AEG-CD-SZ 在两个数据集的所有指标上均持续取得最佳结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。