[論文レビュー] Dynamic Proposals for Efficient Object Detection
本稿では、入力画像の複雑さに応じて提案数を動的に調整できる、プラグアンドプレイ型モジュールである Dynamic Proposals を提案する。この手法により、精度を損なわず推論効率が向上し、Sparse R-CNN や QueryInst などのモデルで最大80%の高速化を達成する。推論に適したオブジェクト数の推定に学習可能な回帰ヘッドを用い、インプレース distillation 戦略を適用することで、性能を安定化させつつ、精度を維持または向上させる。
Object detection is a basic computer vision task to loccalize and categorize objects in a given image. Most state-of-the-art detection methods utilize a fixed number of proposals as an intermediate representation of object candidates, which is unable to adapt to different computational constraints during inference. In this paper, we propose a simple yet effective method which is adaptive to different computational resources by generating dynamic proposals for object detection. We first design a module to make a single query-based model to be able to inference with different numbers of proposals. Further, we extend it to a dynamic model to choose the number of proposals according to the input image, greatly reducing computational costs. Our method achieves significant speed-up across a wide range of detection models including two-stage and query-based models while obtaining similar or even better accuracy.
研究の動機と目的
- 固定された提案数を用いるオブジェクト検出器の非効率性、特に変動する計算リソースに適応できない点を是正すること。
- 1つの訓練済みモデルが、入力画像の複雑さに応じて動的に提案数を選択できるようにすること。
- 検出精度やインスタンスセグメンテーション精度を低下させることなく、計算コストを低減すること。
- 2段階検出器およびクエリベース検出器と互換性のある、プラグアンドプレイ型モジュールを設計すること。
- 動的提案数の推定と特徴の distillation を活用して、推論効率を向上させること。
提案手法
- 入力画像に含まれるオブジェクト数を推定するための回帰ヘッド($\mathcal{M}$ と表記)を用い、提案数の選択を支援する。
- 1つの訓練済みネットワークから、さまざまな数の提案を用いた推論が可能なスイッチ可能な提案メカニズムを採用する。
- インプレース distillation を適用し、全提案モデルから少ない提案数のバージョンへ知識を転送することで、学習の安定化と性能向上を実現する。
- 推定されたオブジェクト数 $\tilde{n}$ を用いて、提案数を動的に選択する。この値は方程式8を介して損失関数に組み込まれる。
- Sparse R-CNN や QueryInst、Faster R-CNN、Mask R-CNN などの既存の検出器に、プラグインモジュールとして統合する。
- 最小限のアーキテクチャ変更で、オブジェクト検出およびインスタンスセグメンテーションの両タスクをサポートする。
実験結果
リサーチクエスチョン
- RQ11つのオブジェクト検出器を、入力画像の複雑さに応じて動的に提案数を調整できるように訓練できるか?
- RQ2提案された動的提案メカニズムは、推論時間を短縮しつつ検出精度を維持できるか?
- RQ3インプレース distillation は、少ない提案数のバージョンの性能をどの程度向上させるか?
- RQ4オブジェクト数推定モジュールは、1枚の画像あたりのオブジェクト数をどの程度正確に予測できるか?
- RQ5動的提案フレームワークは、多様な2段階検出器およびクエリベース検出器に効果的に適用可能か?
主な発見
- Figure 1 に示すように、QueryInst では、類似または向上した AP スコアを維持しながら、最大80%の推論速度向上を達成した。
- MS COCO および Cityscapes ベンチマークの両方で、推定オブジェクト数の平均誤差は5未満である。
- MS COCO および Cityscapes の両方で、提案数推定の4クラス分類精度は97%を超える。
- 真値のオブジェクト数 $n_g$ をオラクルとして用いた場合と、推定値 $\tilde{n}$ を用いた場合の AP スコアはほぼ同一であり、推定モジュールの正確性を裏付けている。
- インプレース distillation により、推論コストを増加させることなく、検出およびインスタンスセグメンテーションの両タスクで AP が最低0.3%向上した。
- 構成番号 $\theta$ を4から12に増加させても、性能はわずかに向上(APで0.2%向上)するが、推論速度に顕著な影響は与えない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。