Skip to main content
QUICK REVIEW

[論文レビュー] ScaleNet: Guiding Object Proposal Generation in Supermarkets and Beyond

Siyuan Qiao, Wei Shen|arXiv (Cornell University)|Apr 22, 2017
Advanced Neural Network Applications参考文献 38被引用数 13
ひとこと要約

本論文では、物体のスケール分布を提案生成の前に予測することで、混雑したスーパー市場や自然画像における検出性能を向上させるスケールに注意を払ったオブジェクト候補フレームワーク、ScaleNetを提案する。ScaleNetによるスケール固有の特徴抽出のガイドラインを用いることで、MS COCOデータセットではAR@1kで最大15.6%、実世界のスーパー市場データでは20%以上、最先端手法を上回るリCALLを実現する。

ABSTRACT

Motivated by product detection in supermarkets, this paper studies the problem of object proposal generation in supermarket images and other natural images. We argue that estimation of object scales in images is helpful for generating object proposals, especially for supermarket images where object scales are usually within a small range. Therefore, we propose to estimate object scales of images before generating object proposals. The proposed method for predicting object scales is called ScaleNet. To validate the effectiveness of ScaleNet, we build three supermarket datasets, two of which are real-world datasets used for testing and the other one is a synthetic dataset used for training. In short, we extend the previous state-of-the-art object proposal methods by adding a scale prediction phase. The resulted method outperforms the previous state-of-the-art on the supermarket datasets by a large margin. We also show that the approach works for object proposal on other natural images and it outperforms the previous state-of-the-art object proposal methods on the MS COCO dataset. The supermarket datasets, the virtual supermarkets, and the tools for creating more synthetic datasets will be made public.

研究の動機と目的

  • 製品が小さく、外観が似ており、密集しているため、高密度なスーパー市場画像において正確なオブジェクト候補を生成するという課題に対処すること。
  • 画像内の主要な物体スケールを予測することで、オブジェクト候補の探索空間を削減し、効率性と正確性を向上させること。
  • 合成学習データから実世界のスーパー市場および自然画像データセットへの一般化が可能なフレームワークを構築すること。
  • スケール予測が、SharpMaskのような既存のオブジェクト候補ネットワークの性能を顕著に向上させられることを示すこと。
  • 一般公開を目的として、2つの実世界スーパー市場データセットと1つの大規模な合成データセットの合計3つの新規データセットを公開すること。

提案手法

  • ScaleNetは、画像内の物体スケールの分布を予測するための深層ニューラルネットワークであり、物体サイズ(最大幅/高さ)と画像サイズ(最大幅/高さ)の比として定義される。
  • 予測されたスケール分布に従って、ベースとなるオブジェクト候補ネットワーク(例:SharpMask)に供給する前に画像をリサイズすることで、推定されたスケールで候補を生成する。
  • 2段階のパイプラインを採用:まずScaleNetがスケール範囲を推定し、次に入力画像をその範囲にリスケーリングして、深層オブジェクト候補モデルで処理する。
  • コンピュータグラフィックス技術を用いて、154,238件の学習オブジェクトと80,452件の検証オブジェクトを含む大規模な合成スーパー市場データセットを生成し、堅牢な学習を可能にした。
  • 本手法は、COCOと合成データでScaleNetを微調整し、学習中に実データを一切使用せずに、実スーパー市場データセットでテストすることで評価した。
  • 本アプローチは、既存の候補ネットワークと互換性があり、性能向上のための前処理ステップとして容易に統合可能である。

実験結果

リサーチクエスチョン

  • RQ1画像内の物体スケール分布を予測することで、混雑したスーパー市場シーンにおけるオブジェクト候補性能を顕著に向上させられるか?
  • RQ2スケールが疎でクラスタリングされたオブジェクトを含むデータセットにおいて、スケールに注意を払った候補フレームワークは、一般向けのオブジェクト候補手法を上回るか?
  • RQ3合成スーパー市場データで学習したモデルは、微調整なしに実世界のスーパー市場画像データセットに効果的に一般化できるか?
  • RQ4スケール予測は、低数の候補数(例:10、100、1,000)における誤検出をどの程度削減し、リCALLを向上させるか?
  • RQ5本手法は、MS COCOおよびスーパー市場固有のベンチマークにおいて、SharpMask や DeepMask などの最先端のオブジェクト候補ネットワークと比較して、どのように優れているか?

主な発見

  • Real-Nearスーパー市場データセットでは、本手法がAR@1000で0.578を達成し、同ベンチマークで前回の最先端手法(0.500)に対して15.6%の改善を達成した。
  • Real-Farデータセットでは、AR@1000が0.557に達し、前回の最先端手法(0.495)に対して12.5%の改善を示した。
  • MS COCOデータセットでは、ボックス候補に対してAR@1000が0.578を達成し、前回の最良手法(0.500)に対して15.6%の相対的改善を示した。
  • COCOにおけるセグメンテーション候補では、AR@1000が0.448に達し、前回の最先端手法(0.392)に対して12.5%の改善を示した。
  • Real-Nearデータセットでは、AR@100で20%以上の相対的改善を達成し、低候補数における顕著な向上を示した。
  • 実データを一切使用せずに学習したモデルが、COCOと合成データで学習した後、実スーパー市場データにうまく一般化されている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。