Skip to main content
QUICK REVIEW

[论文解读] A Comprehensive Survey on Affective Computing; Challenges, Trends, Applications, and Future Directions

Sitara Afzal, H.A. Khan|arXiv (Cornell University)|May 8, 2023
Emotion and Mood RecognitionPsychology被引用 3
一句话总结

本篇综述全面整合了利用机器学习(ML)和混合现实(XR)技术在情感计算领域的最先进技术,聚焦于跨文本、音频、视觉和生理数据的多模态情感识别。它识别出数据稀缺、标注不一致和模型可解释性等关键挑战,并提出未来研究方向,包括多模态数据库、零样本学习以及个性化情感模型,以推动智能人机交互的发展。

ABSTRACT

As the name suggests, affective computing aims to recognize human emotions, sentiments, and feelings. There is a wide range of fields that study affective computing, including languages, sociology, psychology, computer science, and physiology. However, no research has ever been done to determine how machine learning (ML) and mixed reality (XR) interact together. This paper discusses the significance of affective computing, as well as its ideas, conceptions, methods, and outcomes. By using approaches of ML and XR, we survey and discuss recent methodologies in affective computing. We survey the state-of-the-art approaches along with current affective data resources. Further, we discuss various applications where affective computing has a significant impact, which will aid future scholars in gaining a better understanding of its significance and practical relevance.

研究动机与目标

  • 提供对整合了机器学习与混合现实(XR)技术的情感计算方法的全面综述。
  • 识别并分析情感识别中的关键挑战,包括数据稀缺、标注不一致以及模型可解释性。
  • 调查单模态与多模态情感计算中当前最先进的数据集、模型与评估技术。
  • 概述未来研究方向,包括零样本学习、个性化情感建模以及稳健的融合策略。
  • 通过整合现有进展与开放问题,支持情感智能系统的发展。

提出的方法

  • 系统性地调研利用机器学习与混合现实(XR)技术的情感计算研究。
  • 将情感计算方法分类为视觉、音频、文本和生理情感识别(VER、AER/SER、PER)。
  • 分析多模态融合策略,包括深度学习与统计方法,以提升情感识别性能。
  • 评估RAF-PhD、AffectNet、CREMA-D和IEMOCAP等基准数据库在训练与测试情感模型中的应用。
  • 在双通道架构中应用长短期记忆(LSTM)网络,以建模音视频情感信号。
  • 采用如“参考框架跨模态注意力”等框架,用于情感识别与调节建模。
Figure 1: Types of Emotions
Figure 1: Types of Emotions

实验结果

研究问题

  • RQ1如何有效整合机器学习与混合现实技术,以提升情感计算系统的性能?
  • RQ2当前情感计算数据集存在哪些局限性?如何通过新的数据采集与标注策略加以解决?
  • RQ3多模态融合技术如何提升真实应用场景中情感识别的准确率与鲁棒性?
  • RQ4实现可解释且可泛化的感情识别模型面临哪些关键挑战?
  • RQ5如何开发个性化与自适应的情感识别模型,以考虑个体差异与动态情感状态?

主要发现

  • 采用深度学习与融合技术的多模态情感计算系统在复杂情感状态下的识别准确率高于单模态方法。
  • 现有数据集如AffectNet与RAF-PhD虽被广泛使用,但其多样性有限,且在不同文化与个体间存在标注不一致的问题。
  • 基于LSTM的双通道模型能有效处理音频与视觉情感信号,在音乐与面部情感识别任务中显著提升性能。
  • 缺乏标准化的情感标注方案限制了跨研究比较,也影响了模型在多样化人群中的泛化能力。
  • 深度神经网络的“黑箱”特性降低了可信度并阻碍了精细调优,凸显了在情感计算中发展更具可解释性与鲁棒性的机器学习模型的迫切需求。
  • 未来研究应优先关注零样本学习与自监督学习,以提升在低资源或有偏数据场景下的模型稳定性。
Figure 2: Organization of this survey paper.
Figure 2: Organization of this survey paper.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。