Skip to main content
QUICK REVIEW

[论文解读] Grab: Fast and Accurate Sensor Processing for Cashier-Free Shopping

Xiaochen Liu, Yurong Jiang|arXiv (Cornell University)|Jan 4, 2020
IoT and Edge/Fog Computing参考文献 53被引用 5
一句话总结

Grab 提出了一种低成本、高精度的无收银员购物系统,利用现有的门店基础设施——摄像头、RFID 和智能货架,通过基于姿态的追踪主干网络实现实时顾客识别与商品关联。即使在 40% 的对抗性行为下,系统仍能达到 93% 的精确率和 91% 的召回率,通过 GPU 多路复用和优化推理,计算基础设施成本降低 4 倍。

ABSTRACT

Cashier-free shopping systems like Amazon Go improve shopping experience, but can require significant store redesign. In this paper, we propose Grab, a practical system that leverages existing infrastructure and devices to enable cashier-free shopping. Grab needs to accurately identify and track customers, and associate each shopper with items he or she retrieves from shelves. To do this, it uses a keypoint-based pose tracker as a building block for identification and tracking, develops robust feature-based face trackers, and algorithms for associating and tracking arm movements. It also uses a probabilistic framework to fuse readings from camera, weight and RFID sensors in order to accurately assess which shopper picks up which item. In experiments from a pilot deployment in a retail store, Grab can achieve over 90% precision and recall even when 40% of shopping actions are designed to confuse the system. Moreover, Grab has optimizations that help reduce investment in computing infrastructure four-fold.

研究动机与目标

  • 在无需完全重新设计门店的前提下,实现无收银员购物,利用现有的摄像头、RFID 和智能货架。
  • 解决在视觉遮挡和对抗性行为下,实现准确、实时的顾客识别与商品关联的挑战。
  • 在保持高精度的同时降低计算成本,尤其针对需要 >10 fps 处理速度的视觉系统。
  • 开发一种鲁棒的传感器融合框架,整合摄像头、称重传感器和 RFID 数据,实现可靠的购买检测。

提出的方法

  • 使用 OpenPose 在高帧率(≥10 fps)下实现实时人体骨骼估计,作为所有下游任务的核心。
  • 在限定区域内基于关键点进行人脸检测和特征匹配,以实现快速、准确的人员重识别。
  • 引入基于骨骼的匹配并结合颜色增强技术,即使在面部或全身被遮挡时也能追踪个体。
  • 改进 OpenPose 的肢体关联方法,以提高手部追踪精度,从而检测商品取用动作。
  • 应用概率传感器融合框架,整合摄像头、称重传感器和 RFID 数据,以高置信度将商品分配给顾客。
  • 通过 GPU 多路复用和 OpenPose 帧之间的轻量级联合追踪器,将计算负载降低最多 4 倍。

实验结果

研究问题

  • RQ1仅使用现有门店传感器(摄像头、RFID、称重传感器)且无需全面基础设施改造,无收银员购物系统能否实现高精度?
  • RQ2如何优化基于姿态的追踪方法,以实现在遮挡和对抗性行为下的实时、准确顾客识别与手势检测?
  • RQ3传感器融合对复杂、并发购物场景下的鲁棒性和准确性有何影响?
  • RQ4在无收银员系统实时视觉处理中,计算成本可降低多少而不牺牲精度?

主要发现

  • Grab 在真实世界试点部署中实现了 93% 的精确率和 91% 的召回率,即使近 40% 的行为为对抗性行为。
  • 处理帧率低于 10 fps 会显著降低精度,且仅使用深度神经网络的设计无法满足该要求,验证了优化推理的必要性。
  • 若移除关键优化(如肢体关联、距离估计或懒惰追踪),精确率将下降超过 15%,证明这些优化的必要性。
  • 通过 GPU 多路复用和帧跳过策略,系统将所需计算基础设施成本降低最多 4 倍,且不损失精度。
  • 结合摄像头、称重传感器和 RFID 数据的传感器融合至关重要:仅依赖任一模态都会导致显著的精度损失。
  • 基于姿态的方法优于基于边界框的追踪器,在人群密集条件下,后者精确率会降至 50% 以下。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。