Skip to main content
QUICK REVIEW

[论文解读] Semi-supervised Bayesian Deep Multi-modal Emotion Recognition

Changde Du, Changying Du|arXiv (Cornell University)|Apr 25, 2017
Emotion and Mood Recognition参考文献 12被引用 5
一句话总结

本文提出了一种半监督贝叶斯深度多模态自编码器(semiMVAE),通过使用高斯混合模型对后验近似进行建模,联合学习来自多种模态(如EEG、眼动和面部表情)的共享深度表征。该框架通过变分推断利用了有标签和无标签数据,自动学习模态特定的权重,在两个真实世界的情感识别数据集上实现了最先进性能,即使在有标签数据有限的情况下也优于监督和半监督基线方法。

ABSTRACT

In emotion recognition, it is difficult to recognize human's emotional states using just a single modality. Besides, the annotation of physiological emotional data is particularly expensive. These two aspects make the building of effective emotion recognition model challenging. In this paper, we first build a multi-view deep generative model to simulate the generative process of multi-modality emotional data. By imposing a mixture of Gaussians assumption on the posterior approximation of the latent variables, our model can learn the shared deep representation from multiple modalities. To solve the labeled-data-scarcity problem, we further extend our multi-view model to semi-supervised learning scenario by casting the semi-supervised classification problem as a specialized missing data imputation task. Our semi-supervised multi-view deep generative framework can leverage both labeled and unlabeled data from multiple modalities, where the weight factor for each modality can be learned automatically. Compared with previous emotion recognition methods, our method is more robust and flexible. The experiments conducted on two real multi-modal emotion datasets have demonstrated the superiority of our framework over a number of competitors.

研究动机与目标

  • 解决多模态情感识别中生理情感数据质量差且标注数据稀缺的挑战。
  • 通过融合EEG、眼动和面部表情等互补信号,克服单模态情感识别的局限性。
  • 开发一种稳健的半监督学习框架,有效利用大量无标签多模态数据以提升模型泛化能力。
  • 在融合过程中实现自动模态加权,以基于数据特征自适应学习各模态的贡献。

提出的方法

  • 提出一种多视图变分自编码器(MVAE),通过将潜在变量的后验分布建模为高斯混合模型,扩展了VAE框架,实现有效的多模态表征学习。
  • 将半监督分类问题转化为缺失数据填补任务,利用变分推断,使模型在训练过程中能够利用无标签数据。
  • 将深度神经网络与贝叶斯推断相结合,通过可扩展的变分推断方法,联合优化表征学习与分类任务。
  • 引入可学习的模态加权机制,根据各模态的预测能力与可靠性动态调整其贡献。
  • 使用随机梯度下降端到端训练模型,损失函数结合了重构误差与分类损失,并由缩放常数β正则化。
  • 在归纳学习与归纳学习设置下评估泛化性能,涵盖不同数据划分与标签比例。

实验结果

研究问题

  • RQ1深度生成模型能否有效从多种生理与行为模态中学习共享的、解耦的表征?
  • RQ2在标注数据稀缺的情况下,通过半监督学习引入无标签数据在多大程度上提升了性能?
  • RQ3所提出的模型能否在无需人工调参的情况下自动学习最优的模态特定权重?
  • RQ4在不同标签比例下,所提出的半监督多视图VAE相较于监督与现有半监督基线方法的性能如何?
  • RQ5缩放常数β对训练过程中重构与分类目标之间平衡的影响是什么?

主要发现

  • 所提出的semiMVAE框架在SEED与DEAP两个数据集上均实现了最高平均准确率,显著优于所有监督与半监督基线方法,且在所有标签比例下表现一致。
  • 仅使用1%的有标签数据,semiMVAE在SEED数据集上达到86.1% ± 3.7%的准确率,在DEAP数据集上达到42.4% ± 2.0%,甚至超越了在更大有标签数据集上训练的完全监督方法。
  • 在两个数据集上,EEG模态在学习到的模态加权机制中始终被赋予最高权重,反映出其在情感识别中强大的判别能力。
  • semiMVAE的性能随着有标签与无标签数据比例的增加而单调提升,表明其有效利用了两类数据。
  • 缩放常数β对性能有显著影响,最优结果出现在β = 0.1、0.5或1时,表明重构与分类目标之间的平衡至关重要。
  • 浅层图-based半监督模型(AMMSS、AMGL)表现最差,因其无法提取深层层次特征,凸显了深度生成建模的优势。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。