Skip to main content
QUICK REVIEW

[論文レビュー] Detecting retail products in situ using CNN without human effort labeling

Yi Wei, Yaoran Sun|arXiv (Cornell University)|Apr 22, 2019
Visual Attention and Saliency Detection参考文献 26被引用数 5
ひとこと要約

この論文は、畳み込みニューラルネットワーク(CNN)を用いて、実世界の店舗シーンにおける小売製品認識のための弱教師付きオブジェクト検出フレームワークを提案する。手動によるバウンディングボックスのアノテーションを不要にし、in-vitroデータのマイニングと合成遮蔽シミュレーションを活用することで、324の製品カテゴリに対して人為的バウンディングボックスを一切使用せずにFaster R-CNNモデルを学習し、局所化に関する直接的な教師信号がなくても高い検出性能を達成する。

ABSTRACT

CNN is a powerful tool for many computer vision tasks, achieving much better result than traditional methods. Since CNN has a very large capacity, training such a neural network often requires many data, but it is often expensive to obtain labeled images in real practice, especially for object detection, where collecting bounding box of every object in training set requires many human efforts. This is the case in detection of retail products where there can be many different categories. In this paper, we focus on applying CNN to detect 324-categories products in situ, while requiring no extra effort of labeling bounding box for any image. Our approach is based on an algorithm that extracts bounding box from in-vitro dataset and an algorithm to simulate occlusion. We have successfully shown the effectiveness and usefulness of our methods to build up a Faster RCNN detection model. Similar idea is also applicable in other scenarios.

研究の動機と目的

  • 大規模な小売製品検出におけるバウンディングボックスラベリングの高コスト問題を解決すること。
  • 任意の訓練画像に対しても人為的バウンディングボックスを必要としない、CNNベースのオブジェクト検出器の学習を可能にすること。
  • 実世界のin-situシーンにおける324種類の異なる小売製品カテゴリを検出するスケーラブルなソリューションを開発すること。
  • 小売環境における複雑で細分化されたオブジェクト検出において、弱教師付き学習の実現可能性を検討すること。

提案手法

  • 事前学習済みのCNNを用いて、制御されたクリーンな画像における製品の局所化を実行し、in-vitroデータセットから候補となるバウンディングボックスを抽出する。
  • 画像の一部をマスクすることで遮蔽をシミュレートするデータ拡張技術を適用し、現実の複雑な状況や部分的可視性に対するモデルの頑健性を向上させる。
  • 画像ラベルのみを用いてFaster R-CNN検出器を弱教師付きで学習する戦略を採用し、バウンディングボックスの教師信号を一切使用しない。
  • 自動的に生成されたバウンディングボックスと遮蔽拡張データを用いて、モデルをファインチューニングし、局所化の正確性を向上させる。
  • in-vitro画像における製品が良好に分離されており、信頼性のある局所化が可能であるという仮定に依存しており、これにより弱い局所化が実現される。

実験結果

リサーチクエスチョン

  • RQ1人為的バウンディングボックスが一切存在しない状況でも、CNNベースのオブジェクト検出器を効果的に学習させることは可能か?
  • RQ2in-vitroデータセットマイニングは、実世界のin-situ検出に向けた信頼性の高い初期バウンディングボックス提案を生成するのにどの程度有効か?
  • RQ3合成遮蔽シミュレーションは、現実の複雑なシーンへの一般化性能をどの程度向上させるか?
  • RQ4弱教師付き学習は、324カテゴリの大型小売製品データセットにおいて、競争力のある検出性能を達成できるか?

主な発見

  • 提案手法は、人為的バウンディングボックスを一切使用せずに、324の小売製品カテゴリに対してFaster R-CNN検出器を正常に学習させた。
  • in-vitroデータを用いた初期バウンディングボックス抽出は、手動アノテーションの必要性を顕著に低減しつつ、検出品質を維持している。
  • 合成遮蔽シミュレーションはモデルの頑健性を向上させ、部分的遮蔽を伴う実世界のin-situテスト画像において性能を向上させた。
  • モデルはin-situテストセットで競争力ある平均平均精度(mAP)を達成し、複雑な小売環境における弱教師付き検出の実現可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。