Skip to main content
QUICK REVIEW

[論文レビュー] Shift Equivariance in Object Detection

Marco Manfredi, Yu Wang|arXiv (Cornell University)|Aug 13, 2020
Advanced Neural Network Applications参考文献 28被引用数 5
ひとこと要約

本稿では、小さな画像の平行移動による平均平均精度(mAP)の変化を測定することで、オブジェクト検出モデルにおけるシフト等長性を定量化するための新しい評価指標、AP変動(ΔAP)を導入する。研究では、最新の検出器—ワンステージおよびツーフェーズの両方—が、1ピクセルのずれですら顕著な性能低下を示すことが判明した。また、ぼかしプーリングやテスト時増幅といった手法は改善に寄与するが、完全なシフト等長性には至らないことが示された。

ABSTRACT

Robustness to small image translations is a highly desirable property for object detectors. However, recent works have shown that CNN-based classifiers are not shift invariant. It is unclear to what extent this could impact object detection, mainly because of the architectural differences between the two and the dimensionality of the prediction space of modern detectors. To assess shift equivariance of object detection models end-to-end, in this paper we propose an evaluation metric, built upon a greedy search of the lower and upper bounds of the mean average precision on a shifted image set. Our new metric shows that modern object detection architectures, no matter if one-stage or two-stage, anchor-based or anchor-free, are sensitive to even one pixel shift to the input images. Furthermore, we investigate several possible solutions to this problem, both taken from the literature and newly proposed, quantifying the effectiveness of each one with the suggested metric. Our results indicate that none of these methods can provide full shift equivariance. Measuring and analyzing the extent of shift variance of different models and the contributions of possible factors, is a first step towards being able to devise methods that mitigate or even leverage such variabilities.

研究の動機と目的

  • 自動運転などの安全が求められるアプリケーションにおいて極めて重要な、オブジェクト検出器におけるシフト等長性の定量的評価の欠如に対処すること。
  • 1ピクセル程度の小さな画像の平行移動が、現代のオブジェクト検出アーキテクチャのロバストネスにどのように影響するかを調査すること。
  • アーキテクチャ的改良およびデータ増幅技術の、シフト等長性の向上に与える有効性を評価すること。
  • 検出モデルにおけるシフト等長性を測定するための標準的でエンドツーエンドの評価パイプラインを確立すること。

提案手法

  • mAPの下限および上限を、シフトされた画像セット上で計算するための貪欲な探索アルゴリズムを提案し、これらの差分をΔAPという指標として定義する。
  • 検証画像に小さな平行移動(±1ピクセルまで)を適用し、再評価することでmAPの変動を測定する。
  • テスト時増幅(TTA)を用い、各画像の複数のシフト版に対して予測を生成し、非最大抑制(NMS)を用いて統合する。
  • ぼかしプーリング(アンチアリasing)や出力特徴マップの密度化といったアーキテクチャ的改良を適用し、ロバストネスの向上を検証する。
  • COCOおよびDOTAデータセットを用いて、写真家のバイアスがシフト分散に与える影響を評価する。
  • アンカーベースおよびアンカーレスの両設定において、標準的なオブジェクト検出モデル(RetinaNet、Faster R-CNN、CenterNet)を用い、広範な適用性を確保する。

実験結果

リサーチクエスチョン

  • RQ1現代のオブジェクト検出器は、1ピクセル程度の小さな画像の平行移動に対しても、どの程度感受性を示すのか?
  • RQ2ワンステージとツーフェーズの検出器、およびアンカーベースとアンカーレスのアーキテクチャにおいて、シフト分散はどのように異なるのか?
  • RQ3ぼかしプーリング、密度化された特徴マップ、またはテスト時増幅といった既存の技術が、オブジェクト検出におけるシフト分散を効果的に低減できるか?
  • RQ4COCOのようなデータセットに写真家のバイアスが存在する場合、それがシフト等長性に顕著な影響を与えるのか?
  • RQ5テスト時増幅を活用することで、シフト分散を活かして検出性能を向上させることができるか?

主な発見

  • 検査されたすべてのオブジェクト検出器—RetinaNet、Faster R-CNN、CenterNet—は1ピクセルのずれによって顕著な性能低下を示し、モデルやデータセットによってΔAP値は2.2から8.1の範囲で変動した。
  • COCOデータセットにおいて、CenterNetはΔAP = 3.4およびΔAP₅₀ = 8.1を示し、小さな平行移動に対して強い感受性を示していることが判明した。
  • ぼかしプーリングは、ワンステージおよびツーフェーズの両検出器においてΔAPを約30%低減させ、ロバストネスの向上が明確に示された。
  • 出力特徴マップの密度化は、ΔAP₅₀においてわずかだが一貫した改善をもたらし、シフト等長性にわずかな利点があることが示唆された。
  • 写真家のバイアスが存在しない空中画像データセットであるDOTAにおいても、モデルは依然として顕著なシフト分散を示しており、問題の原因が主にデータセットバイアスに起因しているわけではないことが判明した。
  • テスト時増幅により、CenterNetではmAPが最大で1.0(AP)および2.2(AP₅₀)向上した。これは、シフト分散を活用して性能を向上させられることを示しており、推論時間の増加を伴うが有効である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。