Skip to main content
QUICK REVIEW

[论文解读] ARC: A Vision-based Automatic Retail Checkout System

Syed Talha Bukhari, Abdul Wahab Amin|arXiv (Cornell University)|Apr 7, 2021
QR Code Applications and Technologies参考文献 22被引用 7
一句话总结

本文提出ARC,一种基于视觉的低成本自动零售结账系统,利用轻量级卷积神经网络(CNN)从网络摄像头图像中识别零售商品,在受控条件下对100种本地零售产品的自定义数据集上实现了91.7%的测试准确率。该系统消除了对条形码的依赖,使用现成组件和免费云训练资源,实现无需人工监督的自主结账。

ABSTRACT

Retail checkout systems employed at supermarkets primarily rely on barcode scanners, with some utilizing QR codes, to identify the items being purchased. These methods are time-consuming in practice, require a certain level of human supervision, and involve waiting in long queues. In this regard, we propose a system, that we call ARC, which aims at making the process of check-out at retail store counters faster, autonomous, and more convenient, while reducing dependency on a human operator. The approach makes use of a computer vision-based system, with a Convolutional Neural Network at its core, which scans objects placed beneath a webcam for identification. To evaluate the proposed system, we curated an image dataset of one-hundred local retail items of various categories. Within the given assumptions and considerations, the system achieves a reasonable test-time accuracy, pointing towards an ambitious future for the proposed setup. The project code and the dataset are made publicly available.

研究动机与目标

  • 设计一种低成本、自主的零售结账系统,消除对条形码扫描仪和人工操作员的依赖。
  • 评估在最小硬件条件下,使用计算机视觉和深度学习实现实时商品识别的可行性。
  • 证明轻量级CNN可在真实世界、本地获取的零售图像数据集上实现可接受的准确率。
  • 通过支持增量学习和微调新商品而无需完整重训练,实现未来可扩展性。

提出的方法

  • 使用网络摄像头拍摄放置在木制遮蔽罩下的零售商品图像,以减少运动模糊并提高光照一致性。
  • 通过灰度转换、直方图均衡化和图像缩放对图像进行预处理,以标准化CNN的输入。
  • 使用随机梯度下降优化,结合权重衰减(L2正则化系数为0.01)和学习率调度策略训练轻量级CNN架构。
  • 在Google Colab上使用自定义的100种本地零售商品数据集进行训练,训练准确率为94.76%,验证准确率为95.24%。
  • 推理过程每次仅处理单个商品,系统假设视场中无重叠商品,以避免混淆。
  • 系统采用背景减除技术简化目标定位,并减少数据收集过程中的手动标注工作量。

实验结果

研究问题

  • RQ1轻量级CNN能否在使用低成本网络摄像头输入的情况下,实现足够高的准确率以支持实时零售商品识别?
  • RQ2该系统在包装或表面反光性存在细微差异的视觉相似商品上表现如何?
  • RQ3图像预处理在成像条件不佳的情况下,对特征提取和分类鲁棒性的提升程度如何?
  • RQ4模型是否可通过微调整合新商品而无需完整重训练,从而实现长期可扩展性?

主要发现

  • 在受控条件下对100种本地零售商品的数据集上,系统实现了91.7%的测试准确率,证明了其在真实场景部署的可行性。
  • 最严重的误分类发生在视觉高度相似的商品之间,例如商品21被误分类为74(错误率为83.87%),商品87与商品2混淆(错误率为38.71%)。
  • 尽管存在表面反光和镜面包装,系统仍能正确区分多组高度相似商品,如商品95与96,以及商品84、85与86,表明预处理有效提升了特征提取能力。
  • 模型表现出类别偏差,部分商品(如商品2)从未被误分类,提示需采用加权交叉熵损失以提升对难以识别类别的判别能力。
  • 使用Google Colab实现了低成本训练,无需高端本地硬件,支持了系统低成本设计目标。
  • 系统的性能受限于运动模糊和单个商品在视场中的假设,表明未来改进应包括快门速度更快的摄像头以及多目标检测(如YOLO)技术,以提升实时吞吐量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。