Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Feeding: Achieving Fast and Accurate Detections by Adaptively Combining Object Detectors

Hong-Yu Zhou, Bin-Bin Gao|arXiv (Cornell University)|Jul 20, 2017
Advanced Neural Network Applications参考文献 29被引用数 9
ひとこと要約

本稿では、画像の難易度に応じて高速だが不正確な物体検出器と正確だが遅い検出器の間で動的に切り替える、Adaptive Feeding (AF) を提案する。この手法により、追加のトレーニングデータが不要でトレーニングオーバーヘッドが最小限であるにもかかわらず、高速性と正確性の両方を達成する。軽量な分類器を用いて容易な画像を高速検出器にルーティングし、困難な画像を正確な検出器にルーティングすることで、AFは高速検出器の速度と正確な検出器の正確性を両立する。

ABSTRACT

Object detection aims at high speed and accuracy simultaneously. However, fast models are usually less accurate, while accurate models cannot satisfy our need for speed. A fast model can be 10 times faster but 50\% less accurate than an accurate model. In this paper, we propose Adaptive Feeding (AF) to combine a fast (but less accurate) detector and an accurate (but slow) detector, by adaptively determining whether an image is easy or hard and choosing an appropriate detector for it. In practice, we build a cascade of detectors, including the AF classifier which make the easy vs. hard decision and the two detectors. The AF classifier can be tuned to obtain different tradeoff between speed and accuracy, which has negligible training time and requires no additional training data. Experimental results on the PASCAL VOC, MS COCO and Caltech Pedestrian datasets confirm that AF has the ability to achieve comparable speed as the fast detector and comparable accuracy as the accurate one at the same time. As an example, by combining the fast SSD300 with the accurate SSD500 detector, AF leads to 50\% speedup over SSD500 with the same precision on the VOC2007 test set.

研究の動機と目的

  • 高速なモデルは正確性を犠牲にし、正確なモデルはリアルタイム利用に不適切なほど遅いため、物体検出における速度と正確性の根本的トレードオフを解消すること。
  • 再トレーニングや既存の検出器の変更なしに、画像の複雑さに応じて推論時に動的にモデル選択を可能にすること。
  • 適応的ルーティングによる統合により、個々の検出器を上回る速度-正確性の妥協を達成すること。
  • 既存の事前学習済みモデルと軽量なルーティング分類器を活用することで、追加のアノテーションデータが不要で、トレーニングオーバーヘッドを最小限に抑えること。

提案手法

  • 高速検出器(例:SSD300)、正確な検出器(例:SSD500)、および画像の難易度を判断する Adaptive Feeding (AF) 分類器を備えたカスケード検出パイプラインを構築する。
  • 画像の難易度を識別するため、不均衡学習フレームワークを用いて '容易'(高速検出器に適している)と '困難'(正確な検出必要)の画像を分類する。
  • 高速検出器の top-k プロポーザルから特徴を抽出し、AF 分類器の入力として使用する。主な信号として信頼度スコアとプロポーザルの幾何学的特徴を用いる。
  • 効率的なルーティング意思決定のため、高速検出器の出力から得た特徴を用いて、線形SVMをAF分類器として訓練する。
  • AF分類器の予測に基づき、各テスト画像を高速検出器または正確な検出器にルーティングすることで、適応的推論を実現する。
  • 不均衡学習設定におけるサンプリング重みの調整により、再トレーニングなしに速度と正確性のトレードオフを自在に制御できる。

実験結果

リサーチクエスチョン

  • RQ1軽量な分類器が、容易な画像と困難な画像を効果的に識別し、適切な検出器にルーティングできるか?
  • RQ2適応的ルーティングによる高速検出器と正確な検出器の統合により、全体の速度-正確性トレードオフはどの程度改善されるか?
  • RQ3本手法は、個々の検出器をトレーニングするのと比較して、追加のトレーニングデータを必要とするか、顕著なトレーニングオーバーヘッドを伴うか?
  • RQ4複数のベンチマークにおいて、適応的システムの速度と正確性は個々の検出器と比べてどの程度優れているか?
  • RQ5本手法は、アーキテクチャの変更なしに、異なる検出器アーキテクチャやデータセットに一般化可能か?

主な発見

  • PASCAL VOC2007 テストセットでは、AFが SSD300 と SSD500 を組み合わせ、SSD500 よりも 50% の高速化を達成しながら、同じ平均平均精度(mAP)を維持した。
  • AF は SSD500 と同等の正確性(74.9% mAP)と SSD300 と同等の速度(46 FPS)を達成し、バランスの取れた速度-正確性トレードオフを実現した。
  • MS COCO データセットでは、AF システムは高い正確性(72.1% mAP)を維持しながら、SSD300 に近い速度を達成し、両方の個別モデルを総合的に上回る効率性を示した。
  • Caltech Pedestrian データセットにおける歩行者検出では、AF が RPN と CompACT-Deep を組み合わせ、CompACT-Deep よりも 67% の高速化(3 FPS → 5 FPS)を達成し、ミス率の上昇はわずか 0.5% にとどまった。
  • AF 分類器の最も影響力のある特徴は top-k プロポーザルの信頼度であり、多数の高信頼度プロポーザルを持つ画像は '困難' と分類されやすいことを示している。
  • 本手法は、データセットや検出器ペアにかかわらず堅牢であり、追加のトレーニングデータが不要で、ルーティング分類器のトレーニング時間も最小限に抑えられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。