[论文解读] Learning Robust Deep Face Representation
本文提出一种浅层深度卷积网络,采用一种新颖的Max-Feature-Map(MFM)激活函数,以学习鲁棒且紧凑的人脸表征。通过用MFM替代ReLU,该方法保留非零响应并实现稀疏梯度,使模型在无监督设置下的LFW基准上达到97.77%的准确率,优于DeepFace、DeepID2和WebFace,且仅使用单一网络。
With the development of convolution neural network, more and more researchers focus their attention on the advantage of CNN for face recognition task. In this paper, we propose a deep convolution network for learning a robust face representation. The deep convolution net is constructed by 4 convolution layers, 4 max pooling layers and 2 fully connected layers, which totally contains about 4M parameters. The Max-Feature-Map activation function is used instead of ReLU because the ReLU might lead to the loss of information due to the sparsity while the Max-Feature-Map can get the compact and discriminative feature vectors. The model is trained on CASIA-WebFace dataset and evaluated on LFW dataset. The result on LFW achieves 97.77% on unsupervised setting for single net.
研究动机与目标
- 开发一种更鲁棒的深度人脸识别表征学习框架,避免因稀疏ReLU激活导致的信息损失。
- 解决基于验证的损失函数所存在的局限性,如需手动设定阈值及困难负样本挖掘。
- 在不依赖LFW数据集上的监督微调的前提下,提升模型在人脸识别任务中的泛化能力与性能。
- 探索一种替代性激活函数,在保持信息紧凑性的同时支持稀疏梯度更新。
- 通过单一浅层卷积网络在LFW基准上实现最先进性能。
提出的方法
- 模型采用4个卷积层、4个最大池化层和2个全连接层的架构,参数量约为400万。
- Max-Feature-Map(MFM)激活函数通过配对特征图计算最大值:$ f = \max(C^k, C^{k+n}) $,对每个空间位置进行计算。
- MFM的梯度具有稀疏性:若 $ C^k \geq C^{k+n} $,则 $ \frac{\partial f}{\partial C^k} = 1 $,否则为0,从而实现稀疏连接。
- MFM函数应用于每个卷积模块之后,以生成紧凑且具有判别性的特征图,同时减少冗余。
- 数据增强包括将图像随机裁剪至128×128、水平翻转,以及在全连接层应用dropout(保留率0.7)以防止过拟合。
- 模型在CASIA-WebFace数据集(493,456张图像,10,575个身份)上进行训练,使用Caffe框架,权重衰减设置为:大部分层为5e-4,最后一层为5e-3,学习率从1e-3逐步衰减至5e-5。
实验结果
研究问题
- RQ1与ReLU相比,一种紧凑且非稀疏的激活函数是否能提升深度人脸识别表征学习性能?
- RQ2Max-Feature-Map函数是否能在不依赖复杂损失函数的前提下,提升人脸识别的鲁棒性与性能?
- RQ3在无监督训练设置下,浅层单网络架构是否能超越DeepFace和DeepID2等深层模型在LFW基准上的表现?
- RQ4在训练过程中,MFM与ReLU相比在收敛速度和最终验证准确率方面有何差异?
- RQ5MFM模型在未微调LFW数据集的情况下,对未见身份的泛化能力如何?
主要发现
- 所提出的MFM模型在无监督设置下的LFW基准上达到97.77%的准确率,是单网络架构中的最先进结果。
- 尽管收敛速度较慢,MFM激活函数在验证准确率上仍优于ReLU,表明其具有更好的泛化能力与鲁棒性。
- 该模型在单网络设置下性能优于DeepFace(无监督95.92%)、DeepID2(无监督97.75%)和WebFace(无限制97.73%)。
- MFM函数通过选择最活跃的特征图对来实现紧凑表征,同时保留非零响应,相比ReLU减少了信息损失。
- 在最后一层全连接层(fc2)使用较大的权重衰减(5e-3)有效缓解了因参数量过大导致的过拟合问题。
- 该模型在不同身份间泛化能力出色,在未对LFW数据集进行任何监督微调的情况下仍表现出强劲性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。