Skip to main content
QUICK REVIEW

[论文解读] Wildest Faces: Face Detection and Recognition in Violent Settings

Mehmet Kerim Yucel, Yunus Can Bilge|ArXiv.org|May 19, 2018
Face recognition and analysis参考文献 49被引用 8
一句话总结

本文介绍了Wildest Faces数据集,这是一个大规模、公开可用的基准数据集,用于在极端、暴力场景下的人脸识别与检测,涵盖严重模糊、低分辨率、大姿态变化、遮挡以及强烈面部表情等情况。尽管采用了最先进模型,其在单帧评估中的识别准确率仍低于53%,凸显了针对真实世界对抗性条件设计鲁棒模型的必要性。

ABSTRACT

With the introduction of large-scale datasets and deep learning models capable of learning complex representations, impressive advances have emerged in face detection and recognition tasks. Despite such advances, existing datasets do not capture the difficulty of face recognition in the wildest scenarios, such as hostile disputes or fights. Furthermore, existing datasets do not represent completely unconstrained cases of low resolution, high blur and large pose/occlusion variances. To this end, we introduce the Wildest Faces dataset, which focuses on such adverse effects through violent scenes. The dataset consists of an extensive set of violent scenes of celebrities from movies. Our experimental results demonstrate that state-of-the-art techniques are not well-suited for violent scenes, and therefore, Wildest Faces is likely to stir further interest in face detection and recognition research.

研究动机与目标

  • 解决当前缺乏专注于暴力、高压面部场景且视觉退化严重的公开可用数据集的问题。
  • 提供一个基准,用于评估在真实世界恶劣条件(如模糊、低分辨率和遮挡)下的面部检测与识别性能。
  • 探究最先进模型与真实世界暴力场景挑战之间的性能差距。
  • 推动能够处理极端表情和图像退化情况的鲁棒人脸识别模型的研究。
  • 通过提供单帧级标注和时间评估协议,支持基于视频的人脸识别研究。

提出的方法

  • 从暴力电影中的名人场景中精选2,186段视频剪辑,以捕捉极端面部表情和视觉退化。
  • 对人脸进行标注,包括边界框、身份标签以及模糊程度、尺度和遮挡水平等属性。
  • 使用VGGFace和CenterLoss模型,结合与不结合MTCNN对齐方法,评估基于图像的人脸识别性能。
  • 提出一种注意力时间池化机制,用于聚合视频识别中的帧级特征。
  • 训练并比较LSTM架构(单层、双层、双向)在视频识别中的序列建模性能。
  • 为确保LSTM模型间的公平比较,采用RMSprop优化器,固定初始学习率为0.0001,隐藏层大小固定为4096。

实验结果

研究问题

  • RQ1最先进的人脸识别模型在具有极端模糊和遮挡的高退化、暴力场景数据上的表现如何?
  • RQ2在Wildest Faces数据集中,人脸对齐在多大程度上提升了识别准确率?
  • RQ3深度学习模型能否有效识别具有高运动模糊和动态表情的视频序列中的人脸?
  • RQ4在暴力视频剪辑的单帧级人脸识别中,注意力时间池化方法与标准LSTM架构相比表现如何?
  • RQ5当在专为极端真实世界条件设计的数据集上评估时,当前模型的性能极限是什么?

主要发现

  • 最先进基于图像的人脸识别模型在使用对齐的情况下,于Wildest Faces数据集上仅达到39.9%的准确率,表明在极端条件下性能显著下降。
  • 表现最佳的基于图像的方法(CenterLoss配合对齐)达到39.9%的准确率,而VGGFace配合对齐则达到39.7%,表明对齐带来的性能增益微乎其微。
  • 在基于视频的识别中,注意力时间池化方法在单帧级准确率上达到最高,为52.6%,优于所有LSTM变体和多数投票方法。
  • 单层LSTM在单帧级准确率上达到52.3%,优于双层和双向LSTM,表明对此类数据而言,更简单的时序建模可能更有效。
  • VGGFace的帧级准确率达到51.98%,但单帧级准确率下降至49.5%,表明单个镜头内帧间表现不一致。
  • 总体而言,所有模型在单帧级识别上的准确率均低于53%,揭示了在真实世界暴力场景中模型鲁棒性存在显著差距。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。