[论文解读] Enhanced Self-Checkout System for Retail Based on Improved YOLOv10
本文提出 MidState-YOLO-ED,一种轻量级、高精度的目标检测模型,专为零售自助结账系统设计,通过在 YOLOv10 的基础上引入 YOLOv8 的检测头结构,并提出基于 DualConv 的 C2f_Dual 模块与高效多尺度注意力(EMA)模块,显著提升了检测性能。该模型仅使用 330 万个参数和 9.6 GFLOPs,mAP@0.5 达到 89%,mAP@0.5:0.95 达到 69.1%,在准确率与效率方面均显著优于 YOLOv10-n 及基线模型。
With the rapid advancement of deep learning technologies, computer vision has shown immense potential in retail automation. This paper presents a novel self-checkout system for retail based on an improved YOLOv10 network, aimed at enhancing checkout efficiency and reducing labor costs. We propose targeted optimizations to the YOLOv10 model, by incorporating the detection head structure from YOLOv8, which significantly improves product recognition accuracy. Additionally, we develop a post-processing algorithm tailored for self-checkout scenarios, to further enhance the application of system. Experimental results demonstrate that our system outperforms existing methods in both product recognition accuracy and checkout speed. This research not only provides a new technical solution for retail automation but offers valuable insights into optimizing deep learning models for real-world applications.
研究动机与目标
- 解决传统零售结账流程中效率低下与人力成本过高的问题。
- 利用深度学习提升自助结账系统中产品识别的准确率与检测速度。
- 优化 YOLOv10 以适配真实零售场景,增强特征提取能力并降低计算负载。
- 设计适用于自助结账场景的后处理算法,提升检测可靠性。
- 开发一种轻量化、高性能的模型,适用于资源受限的边缘设备部署。
提出的方法
- 将 YOLOv8 的检测头结构集成到 YOLOv10 中,构建 MidState-YOLO 网络,提升特征表征能力与检测准确率。
- 提出 C2f_Dual 模块,用双卷积核替代原始 C2f 模块,减少冗余特征,提升深层网络的特征学习能力。
- 引入高效多尺度注意力(EMA)模块,增强全局上下文建模能力,提升零售产品定位精度。
- 设计定制化后处理算法,优化自助结账环境下的检测结果,降低误检与漏检。
- 在自建零售产品数据集(RPC)上,在一致软硬件条件下对 MidState-YOLO-ED 模型进行训练与评估。
- 以 SSD、Faster R-CNN、YOLOv8-n 和 YOLOv10-n 为基线,开展消融实验与对比实验,验证性能提升效果。
实验结果
研究问题
- RQ1将 YOLOv8 的检测头结构集成到 YOLOv10 中,能否提升零售产品识别的检测准确率?
- RQ2C2f_Dual 模块在多大程度上减少了模型参数量,并改善了零售目标检测中的特征表征能力?
- RQ3EMA 模块在提升小尺寸与复杂结构零售产品实例检测性能方面效果如何?
- RQ4所提出的后处理算法能否显著降低真实自助结账场景中的误检率?
- RQ5MidState-YOLO-ED 模型是否在准确率、推理速度与模型大小之间实现了优于现有 YOLO 变体的更好平衡?
主要发现
- MidState-YOLO-ED 在 mAP@0.5 达到 89.0%,mAP@0.5:0.95 达到 69.1%,相比 YOLOv10-n 提升了 23.2 个百分点,准确率显著提高。
- 模型参数量降至 328.8 万个,GFLOPs 降低至 9.6,具备在边缘设备与实时系统中部署的可行性。
- C2f_Dual 模块相比 YOLOv10-n 减少 15 万个参数,同时将精确率与召回率分别提升 2.3 和 1.6 个百分点。
- EMA 模块使 mAP@0.5 提升 4.2%,证明其在捕捉全局上下文信息与减少误判方面具有显著效果。
- 与 YOLOv8-n 相比,MidState-YOLO-ED 在参数量更少、FLOPs 更低的前提下,实现了更高的精确率(84.7% vs. 82.4%)与召回率(82.5% vs. 80.9%)。
- 消融实验结果证实,结合 YOLOv8 与 YOLOv10 的网络架构,以及所提出的模块,可实现最优整体性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。