Skip to main content
QUICK REVIEW

[论文解读] 2D+3D Facial Expression Recognition via Discriminative Dynamic Range Enhancement and Multi-Scale Learning

Yang Jiao, Yi Niu|arXiv (Cornell University)|Nov 16, 2020
Face and Expression Recognition参考文献 32被引用 7
一句话总结

该论文提出了一种新颖的2D+3D面部表情识别方法,通过信息论的动态范围增强和多尺度学习,提升判别性3D表情特征。通过在深度失真约束下最大化判别深度范围的熵,生成高质量的几何图,减少由不完整点云引起的误估计,在BU-3DFE和Bosphorus数据集上实现了最先进的准确率和图熵表现。

ABSTRACT

In 2D+3D facial expression recognition (FER), existing methods generate multi-view geometry maps to enhance the depth feature representation. However, this may introduce false estimations due to local plane fitting from incomplete point clouds. In this paper, we propose a novel Map Generation technique from the viewpoint of information theory, to boost the slight 3D expression differences from strong personality variations. First, we examine the HDR depth data to extract the discriminative dynamic range $r_{dis}$, and maximize the entropy of $r_{dis}$ to a global optimum. Then, to prevent the large deformation caused by over-enhancement, we introduce a depth distortion constraint and reduce the complexity from $O(KN^2)$ to $O(KNτ)$. Furthermore, the constrained optimization is modeled as a $K$-edges maximum weight path problem in a directed acyclic graph, and we solve it efficiently via dynamic programming. Finally, we also design an efficient Facial Attention structure to automatically locate subtle discriminative facial parts for multi-scale learning, and train it with a proposed loss function $\mathcal{L}_{FA}$ without any facial landmarks. Experimental results on different datasets show that the proposed method is effective and outperforms the state-of-the-art 2D+3D FER methods in both FER accuracy and the output entropy of the generated maps.

研究动机与目标

  • 解决在3D面部表情识别中,弱类别间表情差异被强类别内个性差异所掩盖的挑战。
  • 克服现有地图生成方法中,由于在不完整3D点云上进行局部平面拟合导致的虚假几何估计问题。
  • 通过熵最大化提升高动态范围(HDR)深度数据中的细微表情特征,以最大化信息含量。
  • 提出一种深度失真约束,防止过度增强的同时保持计算效率。
  • 通过无需关键点的面部注意力模块实现多尺度特征学习,自动识别判别性面部区域。

提出的方法

  • 该方法引入一种粗到细的GEMax(全局最优熵最大化)框架,首先从HDR深度数据中选择判别性动态范围 $ r_{dis} $。
  • 将约束熵最大化问题建模为有向无环图(DAG)中的 $ K $-边最大权重路径问题,通过动态规划求解,将复杂度从 $ O(KN^2) $ 降低至 $ O(KN\tau) $。
  • 引入深度失真约束 $ \tau $,以防止在色调映射过程中出现过度增强和几何形变。
  • 通过在不同 $ \tau $ 值下生成多个增强后的深度图,实现多尺度输入表示。
  • 设计了一个端到端可训练的面部注意力(FA)模块,无需面部关键点标注即可定位判别性面部区域。
  • 提出一种新型FA损失 $ \mathcal{L}_{FA} $,用于与主FER网络联合训练FA模块。

实验结果

研究问题

  • RQ1在存在强烈个性差异的情况下,对判别性深度范围进行熵最大化是否能提升面部表情识别性能?
  • RQ2深度失真约束是否能有效防止不完整3D扫描在色调映射过程中的过度增强和几何失真?
  • RQ3无关键点的注意力机制是否能自动识别并聚焦于细微的判别性面部区域,以实现多尺度特征学习?
  • RQ4所提出的基于GEMax的地图生成方法在识别准确率和地图信息含量(熵)方面是否优于传统几何图方法?
  • RQ5结合全脸和局部面部区域特征的多尺度学习是否能共同提升FER性能?

主要发现

  • 在最优深度失真约束 $ \tau = 20 $ 下,该方法在BU-3DFE数据集上达到85.81%的准确率,在Bosphorus数据集上达到80.12%,优于当前最先进方法。
  • 在6 cm的深度范围内识别准确率最高,表明该范围内包含最具判别性的表情信息。
  • 生成地图的熵随 $ \tau $ 增加而上升,在BU-3DFE上达到峰值7.99,在Bosphorus上达到7.98,证实了有效的信息增强。
  • 面部注意力模块在仅使用面部区域时,对BU-3DFE和Bosphorus数据集的准确率分别达到76.39%和68.17%,证明了无需关键点即可有效定位判别区域。
  • 结合全图和FA生成的面部区域特征的多尺度学习,使BU-3DFE上的性能提升至89.72%,Bosphorus上提升至83.63%,表明分层特征表示具有显著优势。
  • 通过在DAG上使用动态规划,将计算复杂度从 $ O(KN^2) $ 降低至 $ O(KN\tau) $,实现了高效的优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。