Skip to main content
QUICK REVIEW

[論文レビュー] RestoreDet: Degradation Equivariant Representation for Object Detection in Low Resolution Images

Ziteng Cui, Yingying Zhu|arXiv (Cornell University)|Jan 7, 2022
Advanced Image Processing Techniques被引用数 4
ひとこと要約

RestoreDet は、ランダムに劣化させた画像ペア間での自己教師付き対照学習を通じて劣化同値表現を学習することにより、低解像度で劣化した画像におけるオブジェクト検出のための新規エンドツーエンドフレームワークである。任意解像度の修復デコーダーを統合することで高精細な詳細を保持し、推論時に明示的な画像修復を伴わずに多様な劣化条件下で最先端の検出精度と推論速度を達成する。

ABSTRACT

Image restoration algorithms such as super resolution (SR) are indispensable pre-processing modules for object detection in degraded images. However, most of these algorithms assume the degradation is fixed and known a priori. When the real degradation is unknown or differs from assumption, both the pre-processing module and the consequent high-level task such as object detection would fail. Here, we propose a novel framework, RestoreDet, to detect objects in degraded low resolution images. RestoreDet utilizes the downsampling degradation as a kind of transformation for self-supervised signals to explore the equivariant representation against various resolutions and other degradation conditions. Specifically, we learn this intrinsic visual structure by encoding and decoding the degradation transformation from a pair of original and randomly degraded images. The framework could further take the advantage of advanced SR architectures with an arbitrary resolution restoring decoder to reconstruct the original correspondence from the degraded input image. Both the representation learning and object detection are optimized jointly in an end-to-end training fashion. RestoreDet is a generic framework that could be implemented on any mainstream object detection architectures. The extensive experiment shows that our framework based on CenterNet has achieved superior performance compared with existing methods when facing variant degradation situations. Our code would be released soon.

研究の動機と目的

  • 事前処理の修復モジュールにおける劣化仮定の不一致が原因で生じる低解像度または劣化画像におけるオブジェクト検出器の性能低下を是正すること。
  • 固定された劣化モデルに依存せずに、表現学習とオブジェクト検出を同時に最適化する汎用的でエンドツーエンドのフレームワークを開発すること。
  • ランダムなダウンサンプリング変換からの自己教師信号を活用して、頑健で劣化不変の特徴表現を学習すること。
  • 高精度な超解像アーキテクチャを任意解像度の修復デコーダー(ARRD)を介して統合し、特徴学習を監視することで検出性能を向上させること。
  • 推論時に高解像度画像を明示的に再構築しないことで、高い検出精度と推論効率を達成すること。

提案手法

  • フレームワークは、ダウンサンプリング比 $ s $、ぼかしカーネル $ k $、ノイズレベル $ n $ で定義されるランダム劣化変換 $ t $ を用い、HR 入力から劣化 LR 画像を生成する。
  • 変換デコーダー $ D_t $ は、元画像と劣化画像ペアの符号化特徴から変換 $ t $ を再構成するように訓練され、表現空間における同値性を強制する。
  • 任意解像度の修復デコーダー(ARRD)$ D_r $ が導入され、劣化表現から元の HR 画像を再構成し、エンコーダーが微細な構造的詳細を保持するように導く。
  • エンコーダー $ E $、変換デコーダー $ D_t $、修復デコーダー $ D_r $、オブジェクト検出ヘッド $ D_o $ はエンドツーエンドで共同最適化される。
  • 推論時、画像修復を伴わないため、エンコーダー $ E $ と検出ヘッド $ D_o $ のみが使用され、高速な推論が可能になる。
  • 学習データには、$ s \in [1,4] $、$ k \in \{k_{\text{iso}}, k_{\text{aniso}}, k_{\text{none}}\} $、ノイズ分散 $ \sim U(0, 25/255) $ の一様分布からサンプリングされたランダムに劣化させた画像が含まれる。

実験結果

リサーチクエスチョン

  • RQ1ランダムな劣化変換による自己教師付き学習が、未知または可変な劣化を持つ低解像度画像におけるオブジェクト検出の頑健性を向上させ得るか?
  • RQ2固定劣化の超解像モデルによる事前処理と比較して、劣化同値表現を学習することは、検出精度と推論効率の両面で優れているか?
  • RQ3明示的な画像再構築なしに、任意解像度の修復デコーダーが、下流の検出タスクのための特徴表現品質をどの程度向上させ得るか?
  • RQ4表現学習と検出の共同最適化は、逐次的な事前処理と検出よりも優れた一般化性能をもたらすか?
  • RQ5事前に劣化モデルの知識がない状態でも、このフレームワークは現実世界の劣化パターンに一般化可能か?

主な発見

  • 変換デコーダー($ D_t $ を備えた)RestoreDet は KITTI データセットで 80.5% AP を達成し、ベースラインの CenterNet(42.2% AP)や、ARRD または $ D_t $ のみを用いたモデルを上回る。
  • 完全な RestoreDet($ D_t $ と $ D_r $ を備える)は、事前処理用の SR モジュールを用いた手法を含め、すべての比較手法の中で最高の検出精度と最も速い推論速度(FPS)を達成した。
  • COCO において固定ダウンサンプリング(2× および 4×)を適用した場合、再トレーニングなしに SOTA 性能を維持し、未観測の劣化レベルに対しても強い一般化性能を示した。
  • ARRD が生成する出力は、特にオブジェクト中心付近で標準的な SR 方法よりもアーティファクトが少なく、マシンビジョンに適した詳細を有している。
  • アブレーションスタディにより、$ D_t $ と $ D_r $ が性能向上に顕著に寄与していることが確認され、$ D_t $ は頑健性を向上させ、$ D_r $ は特徴忠実度を向上させた。
  • 明示的な画像再構築なしに、小サイズオブジェクトでは優れた性能を発揮し、大サイズオブジェクトの検出性能も劣化させないのに対し、事前処理手法では大サイズオブジェクトの検出性能が低下することがある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。