Skip to main content
QUICK REVIEW

[论文解读] From Facial Expression Recognition to Interpersonal Relation Prediction

Zhanpeng Zhang, Ping Luo|arXiv (Cornell University)|Sep 21, 2016
Emotion and Mood Recognition参考文献 75被引用 16
一句话总结

本文提出了一种新颖的孪生深度学习框架,通过利用在异构数据集上训练的多任务卷积网络(其中包含缺失标签),从人脸图像中预测细微的人际关系特质(如友好度、支配力和亲密度)。该方法通过马尔可夫随机场(MRFs)实现属性传播,以统一不同来源的数据,实现在面部表情识别任务上的最先进性能,并在真实世界图像上实现准确且上下文感知的人际关系预测。

ABSTRACT

Interpersonal relation defines the association, e.g., warm, friendliness, and dominance, between two or more people. Motivated by psychological studies, we investigate if such fine-grained and high-level relation traits can be characterized and quantified from face images in the wild. We address this challenging problem by first studying a deep network architecture for robust recognition of facial expressions. Unlike existing models that typically learn from facial expression labels alone, we devise an effective multitask network that is capable of learning from rich auxiliary attributes such as gender, age, and head pose, beyond just facial expression data. While conventional supervised training requires datasets with complete labels (e.g., all samples must be labeled with gender, age, and expression), we show that this requirement can be relaxed via a novel attribute propagation method. The approach further allows us to leverage the inherent correspondences between heterogeneous attribute sources despite the disparate distributions of different datasets. With the network we demonstrate state-of-the-art results on existing facial expression recognition benchmarks. To predict inter-personal relation, we use the expression recognition network as branches for a Siamese model. Extensive experiments show that our model is capable of mining mutual context of faces for accurate fine-grained interpersonal prediction.

研究动机与目标

  • 探究是否能够从野外人脸图像中预测细微的人际关系特质(如友好度、支配力和亲密度)。
  • 解决从具有不完整或缺失属性注释(如性别、年龄、姿态、表情)的异构人脸数据集中学习的挑战。
  • 开发一种深度学习框架,联合建模成对人脸互动,实现超越单人表情识别的高层次关系推理。
  • 通过使用多任务面部表征网络初始化的孪生架构,实现人际关系预测的端到端学习。

提出的方法

  • 训练一个多任务深度卷积网络,联合识别面部表情、性别、年龄和头部姿态,结合现有数据集与新收集的大规模ExpW数据集(包含超过9万个网络图像)。
  • 提出一种基于马尔可夫随机场(MRFs)的新属性传播方法,在训练过程中推断缺失的属性标签,从而在分布差异大且注释不全的数据集之间实现有效学习。
  • 将面部表征网络用作孪生架构中的共享主干网络,其中两个人脸输入并行处理,共享权重,其特征被融合以实现联合关系推理。
  • 端到端训练孪生网络,从成对人脸图像中预测八个人际关系特质(如友好、竞争、支配)。
  • 在最终模型中引入空间上下文线索(如相对人脸位置),以提升关系推理能力,增强在复杂社交互动中的性能。
  • 在带有客观注释的电影帧子集上评估该框架,证明其在真实世界场景中的鲁棒性与可靠性。

实验结果

研究问题

  • RQ1在缺乏显式文本或上下文线索的情况下,能否从人脸图像中准确预测友好度、支配力和亲密度等人际关系特质?
  • RQ2如何有效训练深度神经网络,以处理具有缺失或不一致属性注释的异构人脸数据集?
  • RQ3与单人脸分析相比,成对人脸的联合建模在多大程度上能提升高层次关系特质的预测性能?
  • RQ4通过MRFs进行属性传播是否能有效弥合具有不同统计分布和标注完整度的数据集之间的领域差距?

主要发现

  • 所提出的S-DCN模型在电影测试子集上实现了70.20%的平衡准确率,优于所有消融变体。
  • 包含空间线索的完整S-DCN模型性能最高,表明空间上下文显著提升了关系推理能力。
  • 在基线变体中,使用在表情标签上预训练的DCN模型表现最佳(准确率65.36%),凸显了强大面部表征学习的重要性。
  • 定性结果表明,该模型成功捕捉了动态社交互动,如友好的对话与冲突,如《钢铁侠》场景中高概率地与预期特质对齐。
  • 误报通常源于缺乏上下文信息(如将一本正经的读书场景误判为具有竞争性),表明需要整合多模态上下文信息。
  • 模型预测奥巴马与其女儿之间具有高支配力,默克尔与奥巴马之间具有高竞争性,与现实世界的社会认知一致。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。