Skip to main content
QUICK REVIEW

[論文レビュー] Grab: Fast and Accurate Sensor Processing for Cashier-Free Shopping

Xiaochen Liu, Yurong Jiang|arXiv (Cornell University)|Jan 4, 2020
IoT and Edge/Fog Computing参考文献 53被引用数 5
ひとこと要約

Grabは、既存の店舗インフラ(カメラ、RFID、スマートシェルフ)を活用し、ポーズベースのトラッキングバックボーンを用いることで、低コストで高精度なキャッシャーレスショッピングシステムを実現する。リアルタイムでのショッパー特定と商品関連付けを実現し、40%の悪意ある行動が加わっても93%の精度と91%の再現率を達成。GPUマルチプレクシングと最適化された推論により、計算インフラコストを4倍低減する。

ABSTRACT

Cashier-free shopping systems like Amazon Go improve shopping experience, but can require significant store redesign. In this paper, we propose Grab, a practical system that leverages existing infrastructure and devices to enable cashier-free shopping. Grab needs to accurately identify and track customers, and associate each shopper with items he or she retrieves from shelves. To do this, it uses a keypoint-based pose tracker as a building block for identification and tracking, develops robust feature-based face trackers, and algorithms for associating and tracking arm movements. It also uses a probabilistic framework to fuse readings from camera, weight and RFID sensors in order to accurately assess which shopper picks up which item. In experiments from a pilot deployment in a retail store, Grab can achieve over 90% precision and recall even when 40% of shopping actions are designed to confuse the system. Moreover, Grab has optimizations that help reduce investment in computing infrastructure four-fold.

研究の動機と目的

  • 完全な店舗再設計を要せず、既存のカメラ、RFID、スマートシェルフを活用してキャッシャーレスショッピングを可能にすること。
  • 視覚的遮蔽や悪意ある行動下でも、正確でリアルタイムなショッパー特定と商品関連付けを実現する課題に対処すること。
  • 特に10 fps以上の処理を要するビジョンベースのシステムにおいて、高精度を維持しながら計算コストを低減すること。
  • カメラ、ウェイトセンサー、RFIDデータを統合する、信頼性の高い購入検出を実現する耐障害性の高いセンサーフュージョンフレームワークの開発。

提案手法

  • 高フレームレート(≥10 fps)でのリアルタイムなボディスケルトン推定を実現し、すべての下流タスクの基盤とするためにOpenPoseを採用。
  • 顔領域に限定したキーポoinトベースの顔検出と特徴マッチングを採用し、高速で正確な人物再識別を実現。
  • 顔や全身が遮蔽された場合でも、色補正を施したスケルトンマッチングにより個人を追跡可能にする。
  • OpenPoseの肢の関連付けを最適化し、商品の取り出し動作を検出するための手の追跡精度を向上。
  • カメラ、ウェイトセンサー、RFIDデータを確率的フレームワークで統合し、高信頼性でショッパーに商品を関連付ける。
  • GPUマルチプレクシングとOpenPoseフレーム間の軽量なジョイントトラッカーを採用し、計算負荷を最大4倍低減。

実験結果

リサーチクエスチョン

  • RQ1完全なインフラストラクチャの再設計を伴わずに、既存の店舗センサー(カメラ、RFID、ウェイトセンサー)のみで高精度なキャッシャーレスショッピングシステムを実現できるか?
  • RQ2遮蔽や悪意ある行動下でも、ポーズベースのトラッキングを最適化することで、リアルタイムかつ正確なショッパー特定とジェスチャー検出を実現できるか?
  • RQ3複雑で同時に発生するショッピングシナリオにおいて、センサーフュージョンが信頼性と正確性に与える影響は何か?
  • RQ4リアルタイムビジョン処理を要するキャッシャーレスシステムにおいて、正確性を損なわず、計算コストをどの程度低減できるか?

主な発見

  • 実世界のパイロット導入において、ほぼ40%の行動が悪意ある状況下でも、Grabは93%の精度と91%の再現率を達成。
  • 10 fps未満の処理速度では正確性が著しく低下し、DNNオンリーデザインではこの要件を満たせないため、最適化された推論の必要性が裏付けられた。
  • 肢の関連付け、近接推定、ラージトラッキングなどの主要最適化を削除すると、精度が15%以上低下するため、これらが不可欠であることが実証された。
  • GPUマルチプレクシングとフレームスキップ戦略により、計算インフラ要件を最大4倍低減したが、正確性に影響を与えない。
  • カメラ、ウェイト、RFIDデータのセンサーフュージョンは不可欠である:単一モダリティに依存すると、顕著な正確性の低下が生じる。
  • ボックストラッキングに比べ、ポーズベースのアプローチが優れている。混雑状況下ではボックストラッカーの精度が50%未満に低下する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。