[論文レビュー] Enhanced Self-Checkout System for Retail Based on Improved YOLOv10
本稿では、YOLOv8の検出ヘッドを統合し、DualConvベースのC2f_Dualmoduleと効率的なマルチスケールアテンション(EMA)を導入することで、YOLOv10を強化した、軽量で高精度な物体検出モデルMidState-YOLO-EDを提案する。このモデルは、たった330万パラメータと9.6 GFLOPsで、mAP@0.5が89%、mAP@0.5:0.95が69.1%を達成し、YOLOv10-nやベースラインモデルと比較して、精度と効率の両面で顕著に優れている。
With the rapid advancement of deep learning technologies, computer vision has shown immense potential in retail automation. This paper presents a novel self-checkout system for retail based on an improved YOLOv10 network, aimed at enhancing checkout efficiency and reducing labor costs. We propose targeted optimizations to the YOLOv10 model, by incorporating the detection head structure from YOLOv8, which significantly improves product recognition accuracy. Additionally, we develop a post-processing algorithm tailored for self-checkout scenarios, to further enhance the application of system. Experimental results demonstrate that our system outperforms existing methods in both product recognition accuracy and checkout speed. This research not only provides a new technical solution for retail automation but offers valuable insights into optimizing deep learning models for real-world applications.
研究の動機と目的
- 従来の小売セルフチェックアウトプロセスにおける非効率さと高い人件費を是正すること。
- 深層学習を活用して、セルフチェックアウトシステムにおける製品認識の精度と検出速度を向上させること。
- 特徴抽出の強化と計算負荷の低減を図ることで、YOLOv10を実世界の小売応用に最適化すること。
- セルフチェックアウト環境に特化した後処理アルゴリズムを開発し、検出の信頼性を向上させること。
- リソース制限のあるエッジデバイスへのデプロイに適した、軽量で高性能なモデルを構築すること。
提案手法
- YOLOv8の検出ヘッド構造をYOLOv10に統合し、MidState-YOLOネットワークを構築することで、特徴表現力と検出精度を向上させた。
- C2f_Dualmoduleを提案し、元のC2fブロックを二重畳み込みカーネルに置き換えることで、冗長な特徴を低減し、深層部における特徴学習を改善した。
- 効率的なマルチスケールアテンション(EMA)モジュールを統合し、グローバルな文脈モデリングを強化し、小売製品の局所化精度を向上させた。
- セルフチェックアウト環境における検出結果を精緻化するためのカスタム後処理アルゴリズムを設計し、誤検出と誤検出の数を削減した。
- 一貫したハードウェアおよびソフトウェア環境下で、独自の小売製品データセット(RPC)を用いてMidState-YOLO-EDモデルを訓練および評価した。
- SSD、Faster R-CNN、YOLOv8-n、YOLOv10-nをベースラインとして用い、アブレーションスタディおよび比較実験を実施し、性能向上を検証した。
実験結果
リサーチクエスチョン
- RQ1YOLOv8の検出ヘッドをYOLOv10に統合することで、小売製品認識における検出精度が向上するか?
- RQ2C2f_Dualmoduleは、小売物体検出におけるモデルパラメータをどの程度削減し、特徴表現をどの程度向上させるか?
- RQ3EMAモジュールは、小さく複雑な小売製品インスタンスにおけるモデル性能向上にどの程度効果的か?
- RQ4提案された後処理アルゴリズムは、実世界のセルフチェックアウト環境において誤検出を顕著に低減できるか?
- RQ5MidState-YOLO-EDモデルは、既存のYOLOバージョンと比較して、精度、推論速度、モデルサイズのバランスをより良く達成できるか?
主な発見
- MidState-YOLO-EDは、mAP@0.5が89.0%、mAP@0.5:0.95が69.1%を達成し、YOLOv10-nと比較してmAPで23.2ポイントの向上を示した。
- モデルはパラメータを328万8000に削減し、GFLOPsを9.6にまで低減したため、エッジデバイスやリアルタイムシステムへのデプロイに適している。
- C2f_Dualmoduleは、YOLOv10-nと比較して15万のパラメータを削減し、それぞれ2.3ポイントおよび1.6ポイントの精度と再現率の向上を達成した。
- EMAモジュールはmAP@0.5を4.2%向上させ、グローバルな文脈を捉える有効性と誤予測の低減効果を示した。
- YOLOv8-nと比較すると、MidState-YOLO-EDは顕著に少ないパラメータと低いFLOPsで、精度(84.7% vs. 82.4%)と再現率(82.5% vs. 80.9%)が向上した。
- アブレーションスタディの結果、YOLOv8とYOLOv10のアーキテクチャを統合し、提案されたモジュールを組み合わせた場合が、最も優れた全体的な性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。