Skip to main content
QUICK REVIEW

[论文解读] Detecting and counting tiny faces

Alexandre Attia, Sharone Dayan|arXiv (Cornell University)|Jan 19, 2018
Advanced Image and Video Retrieval Techniques参考文献 12被引用 4
一句话总结

本文提出一种基于foveal描述符和多尺度特征融合的尺度不变人脸检测方法,用于检测极小人脸,在WIDERFACE的easy数据集上达到87%的AP。该方法进一步扩展至通过结合Tiny Faces检测、人脸嵌入和基于SVM的匹配,实现对公共集会中唯一个体的计数,测试片段中准确率达95–98%。

ABSTRACT

Finding Tiny Faces (by Hu and Ramanan) proposes a novel approach to find small objects in an image. Our contribution consists in deeply understanding the choices of the paper together with applying and extending a similar method to a real world subject which is the counting of people in a public demonstration.

研究动机与目标

  • 将Tiny Faces算法适配于真实场景下对公共集会中人群的计数任务。
  • 解决在视频序列中检测并唯一识别极小、重叠或遮挡人脸的挑战。
  • 开发一种可扩展的人员计数流水线,结合人脸检测、嵌入表示与跨帧匹配。
  • 在真实视频数据上评估Tiny Faces与SOTA检测器(如MT-CNN、Faster R-CNN)的性能表现。
  • 探索在低分辨率和模糊条件下的方法局限性,并为未来训练与泛化提出改进方案。

提出的方法

  • 采用多尺度推理流水线,对重采样后的输入应用特定尺度的检测器,以确保尺度不变性。
  • 通过固定大小感受野(291px)在多个CNN层的超列特征上提取foveal描述符,以编码局部细节与全局上下文信息。
  • 在原始分辨率下应用非极大值抑制,以合并重叠检测结果并减少误报。
  • 使用预训练的ResNet101主干网络进行特征提取与推理,因训练模型失败而未进行微调。
  • 在嵌入前使用预训练的关键点检测器进行人脸对齐,并通过仿射变换标准化人脸方向。
  • 利用预训练CNN生成128维人脸嵌入,并通过线性SVM与数据增强(噪声、色彩抖动)实现跨帧人脸匹配。

实验结果

研究问题

  • RQ1Tiny Faces算法在包含极小、重叠与遮挡人脸的真实视频数据上的表现如何?
  • RQ2基于foveal描述符的检测方法能否有效扩展至动态视频序列中的人员计数?
  • RQ3图像分辨率与模糊度对实际场景中Tiny Faces检测性能有何影响?
  • RQ4在有限训练数据下,基于SVM的人脸匹配在跨视频帧唯一个体计数中的有效性如何?
  • RQ5在基于视频的计数任务中,Tiny Faces模型相较于其他SOTA人脸检测器(如MT-CNN、Faster R-CNN)在准确率与速度方面表现如何?

主要发现

  • 在WIDERFACE的easy子集上,Tiny Faces模型达到87%的平均精度(AP),低于原始论文中的92%,表明复现结果表现强劲但略有下降。
  • 随着图像分辨率降低,性能显著下降,表现为小人脸的检测召回率降低,且交并比(Jaccard similarity)下降。
  • 算法对严重模糊的人脸表现较差,表明对图像质量和模糊伪影较为敏感。
  • 在Parade类别(平均每帧34个人脸)中,Tiny Faces以93%的TP/GT表现优于所有基线模型,显著超过MT-CNN(82%)和Faster R-CNN(77%)。
  • 人员计数流水线在clip 1(139个真实标注个体)上达到98% AP,在clip 2(148个真实标注个体)上达到95% AP,表明在唯一个体识别方面具有极高准确率。
  • 通过数据增强(噪声、色彩抖动)与交叉验证阈值的SVM匹配策略提升了精度,F₀.₅-score用于优化误报控制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。