Skip to main content
QUICK REVIEW

[论文解读] PP-ShiTu: A Practical Lightweight Image Recognition System

Shengyu Wei, Ruoyu Guo|arXiv (Cornell University)|Nov 1, 2021
Advanced Image and Video Retrieval Techniques参考文献 3被引用 6
一句话总结

PP-ShiTu 是一个实用且轻量级的图像识别系统,将主体检测、特征提取和向量搜索整合到统一的流水线中。通过利用度量学习、知识蒸馏、模型量化和 DeepHash 等技术,它在多种图像识别任务中实现了高精度与高速推理,相较于现有模型在速度和效率方面表现更优,同时在多个基准测试中保持了具有竞争力的性能。

ABSTRACT

In recent years, image recognition applications have developed rapidly. A large number of studies and techniques have emerged in different fields, such as face recognition, pedestrian and vehicle re-identification, landmark retrieval, and product recognition. In this paper, we propose a practical lightweight image recognition system, named PP-ShiTu, consisting of the following 3 modules, mainbody detection, feature extraction and vector search. We introduce popular strategies including metric learning, deep hash, knowledge distillation and model quantization to improve accuracy and inference speed. With strategies above, PP-ShiTu works well in different scenarios with a set of models trained on a mixed dataset. Experiments on different datasets and benchmarks show that the system is widely effective in different domains of image recognition. All the above mentioned models are open-sourced and the code is available in the GitHub repository PaddleClas on PaddlePaddle.

研究动机与目标

  • 为解决在人脸识别、重识别和产品检索等不同应用中迁移图像识别模型时效率低下和迁移成本高的问题。
  • 设计一个统一且实用的流水线,可在极少微调的情况下泛化于多个图像识别领域。
  • 通过轻量级架构、蒸馏、量化和哈希技术,优化模型的速度与精度。
  • 通过模型压缩和优化的推理流水线,实现在 CPU 和移动设备上的高效推理。
  • 提供开源、可复用的模型与代码,以促进在真实世界应用中的广泛采用。

提出的方法

  • 使用 PP-PicoDet 搭载 PP-LCNet 主干网络,实现图像中主体的高效检测。
  • 采用带有 ArcMargin 损失的度量学习,提升嵌入空间中的特征判别能力。
  • 应用知识蒸馏(U-DML 和 SSLD)将大模型的知识迁移至轻量级学生网络。
  • 利用模型量化技术减小模型尺寸,并加速 CPU 上的推理过程。
  • 通过 DeepHash 实现将特征向量压缩为二进制码,以实现更快的向量搜索。
  • 将所有模块整合为端到端流水线:检测主体 → 提取特征 → 在向量数据库中搜索最近邻。

实验结果

研究问题

  • RQ1一个统一的轻量级流水线是否能有效处理包括产品、人脸和车辆识别在内的多样化图像识别任务?
  • RQ2知识蒸馏与度量学习如何协同提升轻量级模型的精度?
  • RQ3通过 DeepHash 进行特征量化在多大程度上减少了存储空间与推理时间,同时不牺牲检索精度?
  • RQ4PP-PicoDet 与 PP-LCNet 的集成在 CPU 优化推理中如何实现速度与精度的平衡?
  • RQ5在多个数据集上使用混合训练数据对模型泛化能力的性能提升有多大?

主要发现

  • 在 Intel Xeon Gold 6148 CPU 上,PP-ShiTu 的平均延迟为 194ms,相较于基于 ResNet-50 的服务器模型,推理时间减少了 80% 以上。
  • 通过 U-DML 知识蒸馏,系统在六个数据集上的平均 Recall@1 提升了 0.7%,且无额外推理开销。
  • 使用 DeepHash 的二进制特征模型将索引大小从 285MB 降低至 8.9MB,检索时间从 117ms 减少至 21ms,同时在 Ali-Product 数据集上保持了 78% 的 Recall@1。
  • PP-LCNet-1x 在仅 3.0M 参数和 2.46ms 延迟下,实现了 71.32% 的 Top-1 准确率,相较于 MobileNetV3 和 ShuffleNetV2 在速度-精度权衡上表现更优。
  • 系统在 iCartoonFace、VeRI-Wild 和 SOP 等多样化数据集上均保持一致的性能,使用 PP-LCNet-2.5x 搭配 U-DML 时,平均 Recall@1 达到 0.859。
  • 消融实验表明,度量学习、蒸馏与量化技术的结合在精度与效率方面产生了协同增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。