[论文解读] Context-Dependent Models for Predicting and Characterizing Facial Expressiveness
本文引入了BP4D+数据集的扩展版本,包含人工标注的表达力评分,并提出了上下文相关的模型,以从视觉数据中预测瞬时面部表达力。通过统计模型与深度学习模型,研究发现:在不同情绪语境(如惊吓、疼痛、厌恶)下分别建模表达力时,性能显著提升,与真实值的相关性接近人类水平;同时揭示了驱动表达力的语境特异性视觉信号,如动作单元强度与面部位移等。
In recent years, extensive research has emerged in affective computing on topics like automatic emotion recognition and determining the signals that characterize individual emotions. Much less studied, however, is expressiveness, or the extent to which someone shows any feeling or emotion. Expressiveness is related to personality and mental health and plays a crucial role in social interaction. As such, the ability to automatically detect or predict expressiveness can facilitate significant advancements in areas ranging from psychiatric care to artificial social intelligence. Motivated by these potential applications, we present an extension of the BP4D+ dataset with human ratings of expressiveness and develop methods for (1) automatically predicting expressiveness from visual data and (2) defining relationships between interpretable visual signals and expressiveness. In addition, we study the emotional context in which expressiveness occurs and hypothesize that different sets of signals are indicative of expressiveness in different contexts (e.g., in response to surprise or in response to pain). Analysis of our statistical models confirms our hypothesis. Consequently, by looking at expressiveness separately in distinct emotional contexts, our predictive models show significant improvements over baselines and achieve comparable results to human performance in terms of correlation with the ground truth.
研究动机与目标
- 开发自动方法,从视觉数据中预测瞬时面部表达力,这对人工社会智能与心理健康评估等应用至关重要。
- 识别并表征在不同情绪语境下支撑表达力的可解释视觉信号,如面部动作、手势与身体姿态。
- 检验假设:指示表达力的视觉信号集合因情绪语境不同而异(如惊吓 vs. 疼痛 vs. 厌恶)。
- 通过多方面人工评分(反应强度、情绪强度、运动)的潜在变量建模,构建统一的潜在变量表达力评分,以支持稳健建模。
- 通过训练针对特定语境的模型,而非单一通用模型,提升预测性能。
提出的方法
- 在BP4D+数据集基础上,通过人工标注补充了反应强度、情绪强度与身体/面部运动信息,并基于概率建模方法,推导出基于潜在变量的表达力评分。
- 利用OpenFace提取的视觉特征(包括面部关键点、动作单元与运动轨迹),训练深度学习模型与可解释的统计模型(如ElasticNet)。
- 通过按情绪语境(惊吓、疼痛、厌恶)对数据进行分割,训练上下文特异性模型,以建模语境依赖的信号贡献。
- 利用可解释线性模型(ElasticNet)的特征权重,分析并可视化不同语境下特定视觉信号与表达力之间的关系。
- 采用皮尔逊相关系数与NRMSE指标评估模型性能,与真实值及人类基线表现对比,并进行显著性检验。
- 应用潜在变量建模方法,将多维度人工评分整合为单一统一的表达力评分,用于模型训练与评估。
实验结果
研究问题
- RQ1与单一统一模型相比,在不同情绪语境(如惊吓、疼痛、厌恶)下分别建模表达力,是否能显著提升预测性能?
- RQ2在不同情绪语境下,哪些具体视觉信号(如面部动作单元、运动速度或位移)对表达力最具预测力?
- RQ3同一组视觉信号在不同情绪状态下对表达力的贡献程度如何?它们之间存在何种差异?
- RQ4上下文特异性模型能否在表达力预测中达到与人类水平相当的相关性?
- RQ5可解释模型的权重如何揭示所识别视觉信号在心理上的合理性,及其与已知情绪反应的关系?
主要发现
- 上下文特异性模型显著优于通用模型与基线模型,与真实值的相关性达到0.84,接近人类基线的相关性0.86。
- ElasticNet模型与真实值的相关性达到0.84,优于所有基线模型,但其NRMSE仍显著更高,且相关性低于人类基线。
- 在所有语境下,面部运动特征(如动作单元数量、动作单元强度、点位移)是预测表达力最有效的信号。
- 在惊吓语境中,高表达力与更高的点位移与速度、更少的头部位移以及更高的动作单元数量相关,符合反射性惊跳反应的特征。
- 在疼痛语境中,高表达力与更高的动作单元强度与数量相关,但点速度较低,提示为调节性或受控反应,而非运动增强。
- 在厌恶语境中,高表达力与更高的动作单元强度、点位移与头部位移相关,符合对令人反感刺激的后退反应特征。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。