Skip to main content
QUICK REVIEW

[論文レビュー] Multitask AET with Orthogonal Tangent Regularity for Dark Object Detection

Ziteng Cui, Guo-Jun Qi|arXiv (Cornell University)|May 6, 2022
Advanced Neural Network Applications被引用数 15
ひとこと要約

本稿では、自己教師あり枠組みであるMultitask AET with Orthogonal Tangent Regularity (MAET) を提案する。この枠組みは、低照度劣化パラメータと物体検出出力を同時に復元することで、照度に強い表現を学習する。パrametric多様体上でのタスク固有の接ベクトル間の直交性を強制することにより、物体特徴と劣化特徴を分離し、UG²+ DARK FACE データセットで 0.558 の mAP を達成し、前処理を必要とせずに合成および実世界の暗い画像ベンチマークでも優れた性能を示す。

ABSTRACT

Dark environment becomes a challenge for computer vision algorithms owing to insufficient photons and undesirable noise. To enhance object detection in a dark environment, we propose a novel multitask auto encoding transformation (MAET) model which is able to explore the intrinsic pattern behind illumination translation. In a self-supervision manner, the MAET learns the intrinsic visual structure by encoding and decoding the realistic illumination-degrading transformation considering the physical noise model and image signal processing (ISP). Based on this representation, we achieve the object detection task by decoding the bounding box coordinates and classes. To avoid the over-entanglement of two tasks, our MAET disentangles the object and degrading features by imposing an orthogonal tangent regularity. This forms a parametric manifold along which multitask predictions can be geometrically formulated by maximizing the orthogonality between the tangents along the outputs of respective tasks. Our framework can be implemented based on the mainstream object detection architecture and directly trained end-to-end using normal target detection datasets, such as VOC and COCO. We have achieved the state-of-the-art performance using synthetic and real-world datasets. Code is available at https://github.com/cuiziteng/MAET.

研究の動機と目的

  • 人間が最適化した画像強調処理と機械が最適化した物体検出処理の間のギャップを解消すること。
  • 物理的照度劣化をモデル化する一括枠組みとして、自己教師あり表現学習と物体検出処理を統合すること。
  • マルチタスク学習における物体検出と画像修復の特徴の過剰な混合を軽減すること。
  • YOLOv3 などの主流の物体検出器と互換性がある汎用的でエンドツーエンドで学習可能な枠組みを構築すること。
  • 合成および実世界の低照度データを用いて、実世界の暗い環境における耐性を向上させること。

提案手法

  • MAET フレームワークは、ペアドの通常照度および低照度画像から共通の特徴を抽出するためのシアンプルエンコーダーを用いる。
  • 専用のデコーダー $D_{\text{deg}}$ を用いた自己教師ありタスクにより、低照度劣化パラメータ(例:ノイズレベル、ガンマ、ホワイトバランス)を復元する。
  • 共通の特徴から境界ボックスとクラスラベルを予測する第2のデコーダー $D_{\text{obj}}$ を用いて物体検出を実行する。
  • パrametric多様体上での2つのタスク出力の接ベクトル間の直交性を最大化することで、直交接ベクトル正則性を強制する。
  • 前処理や教師データ強化を必要とせず、標準的な検出データセット(例:COCO、VOC)を用いてエンドツーエンドで学習する。
  • 主流の検出器と互換性があり、YOLOv3 や YOLOv5 などのアーキテクチャにも適用可能である。

実験結果

リサーチクエスチョン

  • RQ1統合された枠組みは、低照度物体検出と劣化パラメータ再構成の両方に対して、頑健な視覚的表現を同時に学習可能か?
  • RQ2マルチタスク学習において、物体検出と画像修復の特徴の過剰な混合をどのように軽減できるか?
  • RQ3タスク固有の出力多様体上で幾何的直交性を強制することで、低照度検出における一般化性能が向上するか?
  • RQ4物理的ISPおよびセンサーノイズに基づく自己教師あり劣化モデルは、実世界の暗い画像における検出性能を向上させられるか?
  • RQ5提案手法は、合成および実世界の低照度ベンチマークにおいて、強化処理を先に実行する手法およびエンドツーエンド検出アプローチを上回るか?

主な発見

  • 提案された MAET は UG²+ DARK FACE データセットで 0.558 の mAP を達成し、Zero-DCE や KIND を強化した YOLO よりも優れた性能を示した。
  • ExDark データセットでは、ほとんどのカテゴリで高い mAP を達成し、実世界の低照度条件下での有効性を確認した。
  • 直交接ベクトル正則性を適用した MAET(MAET w/ ort)は 0.558 mAP を達成した一方、正則性なしの MAET は 0.542 mAP であった。これにより、特徴の分離が有効であることが示された。
  • COCO データセットでは、MAET はベースラインの YOLOv3 や強化ベースの手法(例:Lv ら、Zhang ら)を顕著に上回った。
  • 前処理や教師データ強化を必要とせず、合成および実世界の暗い画像データセットで最先端の性能を達成した。
  • アブレーションスタディにより、直交接ベクトル正則性が特徴の混合を効果的に低減し、検出の耐性を向上させることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。