Skip to main content
QUICK REVIEW

[論文レビュー] SALISA: Saliency-based Input Sampling for Efficient Video Object Detection

Babak Ehteshami Bejnordi, Amirhossein Habibian|arXiv (Cornell University)|Apr 5, 2022
Visual Attention and Saliency Detection被引用数 4
ひとこと要約

SALISAは、可微分な薄板スプライン空間変換ネットワークを用いて、顕著な領域の詳細を保持する非一様な入力サンプリング手法を提案する。この手法により、高解像度の動画フレームをダウンサンプリングしつつも、細粒度の詳細を維持でき、計算コストを著しく削減した状態で最先端の検出性能を達成する。ImageNet-VIDおよびUA-DETRACで、EfficientDet-D1のバックボーンのみを用いてEfficientDet-D2と同等のmAPを達成した。

ABSTRACT

High-resolution images are widely adopted for high-performance object detection in videos. However, processing high-resolution inputs comes with high computation costs, and naive down-sampling of the input to reduce the computation costs quickly degrades the detection performance. In this paper, we propose SALISA, a novel non-uniform SALiency-based Input SAmpling technique for video object detection that allows for heavy down-sampling of unimportant background regions while preserving the fine-grained details of a high-resolution image. The resulting image is spatially smaller, leading to reduced computational costs while enabling a performance comparable to a high-resolution input. To achieve this, we propose a differentiable resampling module based on a thin plate spline spatial transformer network (TPS-STN). This module is regularized by a novel loss to provide an explicit supervision signal to learn to "magnify" salient regions. We report state-of-the-art results in the low compute regime on the ImageNet-VID and UA-DETRAC video object detection datasets. We demonstrate that on both datasets, the mAP of an EfficientDet-D1 (EfficientDet-D2) gets on par with EfficientDet-D2 (EfficientDet-D3) at a much lower computational cost. We also show that SALISA significantly improves the detection of small objects. In particular, SALISA with an EfficientDet-D1 detector improves the detection of small objects by $77\%$, and remarkably also outperforms EfficientDetD3 baseline.

研究の動機と目的

  • 動画像オブジェクト検出における高解像度フレーム処理の高コストを軽減すること。
  • 高解像度入力の単純なダウンサンプリングによって引き起こされる性能低下を克服すること。
  • 小規模または中規模のオブジェクトの精度を損なわずに、リソース制約のあるデバイスでも効率的な検出を可能にすること。
  • 明示的な監視を用いて顕著な領域に焦点を当てた、可微分で歪みのない再サンプリング機構を開発すること。
  • 標準的な動画像オブジェクト検出ベンチマークで、低計算量環境下でも最先端の性能を達成すること。

提案手法

  • 最初のフレームに対して高解像度の検出モデルを適用し、重要な領域を示す顕著マップを生成する。
  • 可微分な薄板スプライン空間変換ネットワーク(TPS-STN)を用いて、顕著性に基づく空間変換に従い、現在のフレームを変形・再サンプリングする。
  • TPS-STNが非パrametricな注目ベースのサンプラーを模倣するよう促す、新しい正則化損失を導入する。これにより、顕著領域での詳細の保持が保証される。
  • TPSのサンプリンググリッドと注目ベースのグリッドとの間で重み付きℓ₂損失を用いることで、顕著コンテンツの拡大を明示的な監視で促進する。
  • 非一様に入力をダウンサンプリングする—背景の解像度を積極的に低下させつつ、顕著領域の解像度を維持する。
  • 空間的に小さく、詳細が保持された画像を、軽量な検出器(例:EfficientDet-D1)に供給することで、FLOPsを削減しつつ性能を維持する。

実験結果

リサーチクエスチョン

  • RQ1非一様で顕著性に従う入力再サンプリングは、計算コストを削減しつつも、動画像オブジェクト検出で高い検出精度を達成できるか?
  • RQ2可微分な再サンプリングモジュールをどのように学習すれば、アーティファクトを生成せずに顕著領域の細粒度の詳細を保持できるか?
  • RQ3顕著性に基づく入力サンプリングを用いる場合、軽量な検出器(例:EfficientDet-D1)が、重い検出器(例:EfficientDet-D2 や D3)と同等の性能を達成できるか、その程度はいかほどか?
  • RQ4提案手法は、単純なダウンサンプリングで消失しがちな小サイズオブジェクトの検出を改善するか?
  • RQ5TPS変換における制御点の数は、再サンプリングされた入力の品質とロバストネスにどのように影響するか?

主な発見

  • SALISAは、EfficientDet-D1のバックボーンのみを用いて、UA-DETRACでEfficientDet-D2と同等のmAPを達成し、FLOPsを著しく削減した。
  • UA-DETRACにおいて、SALISAとEfficientDet-D1を組み合わせることで、小サイズオブジェクトの検出性能がベースラインのEfficientDet-D1比で77%向上した。
  • UA-DETRACにおいて、SALISAはEfficientDet-D3のベースラインを上回り、モデルスケーリングを超えた性能向上を実現した。
  • 面積閾値αを調整することで、小サイズオブジェクトのmAPが13.1%(α=2.0)から14.9%(α=0.5)に向上した。
  • TPSに1024個の制御点を使用した場合、EfficientDet-D1のmAPが59.1%から49.5%に低下し、過剰な柔軟性が性能を劣化させることを示した。
  • 重いキーフレーム検出器(例:D3)と軽量なメイン検出器(例:D0)を組み合わせた場合、FLOPsが42%増加したもののmAPはわずか0.3%向上にとどまり、収益逓減の兆しを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。