Skip to main content
QUICK REVIEW

[论文解读] ACFD: Asymmetric Cartoon Face Detector

Bin Zhang, Jian Li|arXiv (Cornell University)|Jul 2, 2020
Face recognition and analysis参考文献 28被引用 11
一句话总结

ACFD 是一种用于卡通人脸检测的新型单阶段锚框检测器,引入了定制主干网络(VoVNetV3)、非对称双向特征金字塔网络(ABi-FPN)、动态锚框匹配(DAM)以及边缘二值分类(MBC),以应对极端姿态、大纵横比变化以及高分类难度等问题。在 2020 年 iCartoon Face 挑战赛中,ACFD 在 200MB 模型大小和 50ms 推理时间的严格约束下,取得了 92.91% 的 mAP,位列第一。

ABSTRACT

Cartoon face detection is a more challenging task than human face detection due to many difficult scenarios is involved. Aiming at the characteristics of cartoon faces, such as huge differences within the intra-faces, in this paper, we propose an asymmetric cartoon face detector, named ACFD. Specifically, it consists of the following modules: a novel backbone VoVNetV3 comprised of several asymmetric one-shot aggregation modules (AOSA), asymmetric bi-directional feature pyramid network (ABi-FPN), dynamic anchor match strategy (DAM) and the corresponding margin binary classification loss (MBC). In particular, to generate features with diverse receptive fields, multi-scale pyramid features are extracted by VoVNetV3, and then fused and enhanced simultaneously by ABi-FPN for handling the faces in some extreme poses and have disparate aspect ratios. Besides, DAM is used to match enough high-quality anchors for each face, and MBC is for the strong power of discrimination. With the effectiveness of these modules, our ACFD achieves the 1st place on the detection track of 2020 iCartoon Face Challenge under the constraints of model size 200MB, inference time 50ms per image, and without any pretrained models.

研究动机与目标

  • 解决卡通人脸检测中的独特挑战,包括极端姿态、大纵横比变化(>3 或 <1/3),以及与背景或身体部位高度相似的问题。
  • 设计对类内可变性和类间模糊性具有鲁棒性的检测器,因为卡通人脸的复杂性高于真实人脸。
  • 构建轻量化、高效率的网络架构,满足严格的部署约束:模型大小不超过 200MB,单张图像推理时间不超过 50ms。
  • 通过针对卡通人脸特性的新型神经网络组件,提升特征表示、回归与分类能力。
  • 在真实部署约束下,于 iCartoon Face 挑战赛检测赛道实现最先进性能。

提出的方法

  • 提出 VoVNetV3,一种基于非对称单次聚合模块(AOSA)的新型主干网络,以提取具有多样化感受野的多尺度特征。
  • 引入 ABi-FPN,一种非对称双向特征金字塔网络,用于融合并增强多尺度特征,提升语义理解能力。
  • 设计一种动态锚框匹配(DAM)策略,利用回归后的边界框动态分配高质量锚框,改善回归初始化。
  • 采用具有最优边缘值(m=0.2)的边缘二值分类(MBC)损失,增强正样本与负样本之间的判别能力。
  • 应用模型优化技术,包括批归一化与卷积层融合,以及转换为 TensorRT,将推理时间降低至 50ms 以下。
  • 采用单阶段检测器流程,将步长为 4 到 128 的特征图输入 ABi-FPN 以生成最终预测。

实验结果

研究问题

  • RQ1基于非对称卷积模块的定制主干网络是否能显著提升卡通人脸检测的特征多样性与表征能力?
  • RQ2非对称双向特征金字塔网络(ABi-FPN)在聚合与增强具有极端姿态和纵横比的人脸多尺度特征方面是否有效?
  • RQ3利用回归边界框进行动态锚框匹配是否能相比标准 IoU 匹配策略,提升回归性能并减少误检?
  • RQ4基于边缘的分类损失(MBC)是否能在负样本大量存在的密集预测场景中提升判别能力?
  • RQ5架构创新与推理优化在多大程度上能够支持在 200MB 模型大小与 50ms 推理时间严格约束下实现 SOTA 性能?

主要发现

  • ACFD 在 iCartoon Face 挑战赛排行榜上取得了 92.91% 的 mAP,满足 200MB 模型大小与 50ms 推理时间的严格约束,位列第一。
  • 消融实验表明,将所有提出的模块(VoVNetV3、ABi-FPN、DAM、MBC)加入 ResNet50 基线后,多尺度测试下的 mAP 从 87.13% 提升至 90.94%。
  • 与基线锚框分配相比,动态锚框匹配(DAM)策略使 mAP 提升了 1.3 个百分点(从 87.65% 提升至 88.90%)。
  • 采用 m=0.2 的边缘二值分类(MBC)损失取得了最高的 mAP(90.73%),优于其他边缘值及标准交叉熵损失。
  • 通过模型优化(包括层融合与 TensorRT 转换),推理时间成功降低至 50ms 以下,支持实时部署。
  • 在具有极端纵横比(超过 3 或低于 1/3)的人脸等困难样本上,模型仍保持强大泛化能力,如图 4 所示的定性结果所示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。