Skip to main content
QUICK REVIEW

[论文解读] Optimizing Filter Size in Convolutional Neural Networks for Facial Action Unit Recognition

Shizhong Han, Zibo Meng|arXiv (Cornell University)|Jul 26, 2017
Speech and Audio Processing参考文献 13被引用 4
一句话总结

该论文提出了一种新型CNN框架——优化滤波器尺寸卷积神经网络(OFS-CNN),通过反向传播过程中的可微优化,联合学习最优卷积滤波器尺寸与权重。通过将滤波器尺寸视为连续变量,并利用上下界滤波器进行插值,OFS-CNN在显著提升推理速度的同时,实现了比使用多种固定滤波器尺寸的模型更优的面部动作单元(AU)识别性能,且能自适应不同图像分辨率。

ABSTRACT

Recognizing facial action units (AUs) during spontaneous facial displays is a challenging problem. Most recently, Convolutional Neural Networks (CNNs) have shown promise for facial AU recognition, where predefined and fixed convolution filter sizes are employed. In order to achieve the best performance, the optimal filter size is often empirically found by conducting extensive experimental validation. Such a training process suffers from expensive training cost, especially as the network becomes deeper. This paper proposes a novel Optimized Filter Size CNN (OFS-CNN), where the filter sizes and weights of all convolutional layers are learned simultaneously from the training data along with learning convolution filters. Specifically, the filter size is defined as a continuous variable, which is optimized by minimizing the training loss. Experimental results on two AU-coded spontaneous databases have shown that the proposed OFS-CNN is capable of estimating optimal filter size for varying image resolution and outperforms traditional CNNs with the best filter size obtained by exhaustive search. The OFS-CNN also beats the CNN using multiple filter sizes and more importantly, is much more efficient during testing with the proposed forward-backward propagation algorithm.

研究动机与目标

  • 为解决传统CNN在自发性面部动作单元(AU)识别中因固定滤波器尺寸不佳而导致的性能瓶颈问题。
  • 消除在不同图像分辨率下为寻找最优滤波器尺寸而进行昂贵的超参数穷举搜索的需求。
  • 开发一种可微分、端到端可训练的方法,实现在反向传播过程中联合优化滤波器尺寸与卷积权重。
  • 在识别准确率和推理效率方面,超越现有采用固定或多种滤波器尺寸的CNN模型。

提出的方法

  • 将滤波器尺寸视为连续可微变量,而非离散超参数。
  • 使用上下界整数尺寸滤波器,通过插值近似实现连续滤波器尺寸的卷积操作。
  • 执行前向传播时,将激活输出表示为上下界滤波器输出的加权插值。
  • 利用反向传播推导损失函数对滤波器尺寸的梯度,从而通过随机梯度下降迭代优化滤波器尺寸。
  • 引入一种变换操作,在最优连续滤波器尺寸变化时更新上下界滤波器的尺寸。
  • 采用联合前向-反向传播算法,同步更新滤波器权重与滤波器尺寸。

实验结果

研究问题

  • RQ1在端到端CNN训练中,滤波器尺寸能否作为连续可微变量被有效优化,用于AU识别?
  • RQ2与固定尺寸或多种固定尺寸滤波器相比,每层学习最优滤波器尺寸是否能提升AU识别性能?
  • RQ3所提方法在自发性AU数据库上是否能实现优于当前SOTA CNN模型的准确率与推理速度?
  • RQ4OFS-CNN在不同输入图像分辨率下的泛化能力如何?
  • RQ5该模型能否自动适应不同空间尺度的AU相关面部线索,实现滤波器尺寸的自适应调整?

主要发现

  • 在256×192分辨率下,OFS-CNN在BP4D数据集上的平均F1得分比基线CNN高出6%,且优于通过穷举搜索找到的最佳固定滤波器尺寸。
  • 在BP4D数据集上,OFS-CNN实现了53.7%的平均F1得分,超过GoogLeNet(100层)的53.1%,尽管后者使用了6.7倍的训练迭代次数。
  • 在推理阶段,OFS-CNN在128×96图像上比GoogLeNet快8倍以上,在256×192图像上快6倍以上,展现出卓越的效率优势。
  • 在DISFA数据集上,OFS-CNN实现了55.3%的平均F1得分,优于基线CNN(51.5%),并达到或超过当前SOTA方法。
  • OFS-CNN对不同图像分辨率表现出强鲁棒性,无需重新训练即可自动学习适配不同输入尺度的滤波器尺寸。
  • 该模型在BP4D和DISFA两个数据集上均达到SOTA性能,超越了先前基于CNN的方法(包括PL-CNN和ML-CNN)。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。