Skip to main content
QUICK REVIEW

[论文解读] CLIPER: A Unified Vision-Language Framework for In-the-Wild Facial Expression Recognition

Hanting Li, Hongjing Niu|arXiv (Cornell University)|Mar 1, 2023
Emotion and Mood Recognition被引用 4
一句话总结

CLIPER 提出了一种统一的视觉-语言框架,用于开放环境下的面部表情识别(FER),通过利用 CLIP 的对比预训练,并引入多种表情文本描述(METD),为每种表情学习细粒度、可解释的文本提示。它通过自动生成多样化、语义丰富的文本描述来捕捉真实世界中表情的多样性,在五个开放环境 FER 基准上实现了最先进性能。

ABSTRACT

Facial expression recognition (FER) is an essential task for understanding human behaviors. As one of the most informative behaviors of humans, facial expressions are often compound and variable, which is manifested by the fact that different people may express the same expression in very different ways. However, most FER methods still use one-hot or soft labels as the supervision, which lack sufficient semantic descriptions of facial expressions and are less interpretable. Recently, contrastive vision-language pre-training (VLP) models (e.g., CLIP) use text as supervision and have injected new vitality into various computer vision tasks, benefiting from the rich semantics in text. Therefore, in this work, we propose CLIPER, a unified framework for both static and dynamic facial Expression Recognition based on CLIP. Besides, we introduce multiple expression text descriptors (METD) to learn fine-grained expression representations that make CLIPER more interpretable. We conduct extensive experiments on several popular FER benchmarks and achieve state-of-the-art performance, which demonstrates the effectiveness of CLIPER.

研究动机与目标

  • 解决现有 FER 方法依赖独热编码或软标签时语义可解释性不足的问题。
  • 通过将视觉-语言预训练适配到抽象、复合的面部表情类别,克服标准 CLIP 在 FER 中的局限性。
  • 开发一种统一框架,适用于非受限环境中静态与动态面部表情识别。
  • 自动学习每类表情的多样化、细粒度的文本描述,避免人工提示工程。
  • 通过学习反映表情细微差异(如“有点开心”与“非常开心”)的文本嵌入,提升模型可解释性。

提出的方法

  • 通过使用文本作为监督信号而非独热标签,将 CLIP 的对比视觉-语言预训练适配到面部表情识别。
  • 引入多种表情文本描述(METD),其中每个表情类别关联 K 个独立的文本嵌入(K=5),通过两阶段训练过程学习。
  • 每个 METD 标记是一个可学习的连续文本嵌入,通过对比损失进行优化,使其与同类别图像特征对齐。
  • 使用时间平均池化聚合帧级特征以处理动态 FER,避免复杂的时序建模。
  • 采用两阶段训练范式:首先,使用 CLIP 的预训练视觉编码器微调图像编码器;其次,使用图像-文本对齐的对比损失训练 METD 嵌入。
  • 利用 CLIP 的预训练文本编码器初始化并引导 METD 的学习,确保与自然语言的语义一致性。

实验结果

研究问题

  • RQ1对比视觉-语言预训练能否有效适配到开放环境下的面部表情识别任务中,其中表情类别抽象且多变?
  • RQ2如何在不依赖人工提示工程的前提下,自动生成语义丰富且多样的表情文本描述?
  • RQ3与单类提示相比,每个表情类别使用多个文本描述是否能提升模型性能与可解释性?
  • RQ4METD 在多大程度上能捕捉到表情的细粒度差异,例如强度或表达形式(如微笑 vs. 大笑)?
  • RQ5在非受限环境下,CLIPER 是否在静态与动态 FER 基准上均优于现有最先进方法?

主要发现

  • CLIPER 在五个开放环境 FER 基准(包括 RAF-DB、AffectNet 和 FER2013)上实现了最先进性能,优于先前的 SOTA 方法。
  • 通过 METD 学习到更鲁棒、语义更丰富的文本描述,显著提升了在 FER 数据集上的零样本泛化能力。
  • 可视化结果表明,METD 不仅学习到直接与表情相关的词汇(如“最悲伤”对应“悲伤”),还学习到语义相关概念(如“丧尸”对应“惊讶”),体现出良好的可解释性。
  • 该方法成功学习到表情的细粒度子类:例如 RAF-DB 中的 HA₁ 和 HA₃ 分别对应“开心”表情中细微的强度差异(微笑 vs. 大笑)。
  • 尽管仅使用时间平均池化(无复杂时序建模),CLIPER 仍实现了强劲的 DFER 性能,表明其具备强大的特征表示能力。
  • 对学习到的 METD 标记最近邻词汇的完整列表确认,模型捕捉到了表情的多样化语义形式,如“咆哮”对应愤怒,“善意”对应快乐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。