Skip to main content
QUICK REVIEW

[論文レビュー] Translation, Scale and Rotation: Cross-Modal Alignment Meets RGB-Infrared Vehicle Detection

Maoxun Yuan, Yinyan Wang|arXiv (Cornell University)|Sep 28, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、空中RGB赤外線(RGB-IR)車両検出におけるクロスモダリティ弱い不整合問題に対処するため、翻訳・スケール・回転アライメント(TSRA)モジュールを提案する。物体はモダリティ間で位置、スケール、方向に差異を示す。アライメントプロセスを通じてこれらのずれを予測・補正し、モダリティ選択戦略を用いることで、TSFADet検出器はDroneVehicleデータセットで73.06%のmAPを達成し、最先端の性能を示した。これは、ハードウェア的要因およびアノテーション由来の不整合要因を効果的に解消した結果である。

ABSTRACT

Integrating multispectral data in object detection, especially visible and infrared images, has received great attention in recent years. Since visible (RGB) and infrared (IR) images can provide complementary information to handle light variations, the paired images are used in many fields, such as multispectral pedestrian detection, RGB-IR crowd counting and RGB-IR salient object detection. Compared with natural RGB-IR images, we find detection in aerial RGB-IR images suffers from cross-modal weakly misalignment problems, which are manifested in the position, size and angle deviations of the same object. In this paper, we mainly address the challenge of cross-modal weakly misalignment in aerial RGB-IR images. Specifically, we firstly explain and analyze the cause of the weakly misalignment problem. Then, we propose a Translation-Scale-Rotation Alignment (TSRA) module to address the problem by calibrating the feature maps from these two modalities. The module predicts the deviation between two modality objects through an alignment process and utilizes Modality-Selection (MS) strategy to improve the performance of alignment. Finally, a two-stream feature alignment detector (TSFADet) based on the TSRA module is constructed for RGB-IR object detection in aerial images. With comprehensive experiments on the public DroneVehicle datasets, we verify that our method reduces the effect of the cross-modal misalignment and achieve robust detection results.

研究の動機と目的

  • 空中RGB-IRオブジェクト検出におけるクロスモダリティ弱い不整合問題を特定・分析すること。特に、可視光と赤外線画像間でオブジェクトの位置・スケール・方向にずれが生じる要因を明らかにすること。
  • センサの不整合などのハードウェア的制限およびペアドRGB-IR空中画像における人為的アノテーション誤差に起因する不整合を是正すること。
  • 空中画像におけるマルチスペクトル検出精度を向上させる、ロバストでエンド・トゥ・エンドでトレーニング可能な2ストリーム特徴アライメント検出器(TSFADet)を開発すること。
  • TSRAモジュールおよびその構成要素(アライメントプロセス、モダリティ選択戦略、マルチタスクジッター)の有効性を、実世界の空中データセット上で評価すること。

提案手法

  • TSRAモジュールは、学習可能なアライメントプロセスを用いて、RGBとIR特徴マップ間のトランスレーション・スケール・回転のずれを予測し、クロスモダリティ不整合を補正する。
  • モダリティ選択(MS)戦略は、各提案に対して最も正確なバウンディングボックスリファレンス(RGBまたはIR)を動的に選択することで、ノイズの多いアノテーションからの誤差伝搬を低減する。
  • マルチタスクジッター技術は、バウンディングボックスにランダムなずれを適用することでトレーニングデータを拡張し、弱い不整合入力に対してもモデルのロバスト性を向上させる。
  • TSFADet検出器はTSRAモジュールを2ストリーム特徴アライメントフレームワークに統合し、RGB-IRオブジェクト検出のエンド・トゥ・エンド学習を可能にする。
  • 本手法はResNet-50をバックボーンとして用い、標準的なデータオーグメンテーションと、局所化精度を向上させる2段階検出ヘッドを用いてトレーニングされる。
  • アライメントプロセスは各提案ごとに適用され、モダリティ間の位置・スケール・角度の差異を細かく補正可能である。

実験結果

リサーチクエスチョン

  • RQ1空中RGB-IRオブジェクト検出におけるクロスモダリティ弱い不整合問題の原因は何か。特に、位置・スケール・方向のずれに関して。
  • RQ2深層学習モジュールが、空中画像におけるRGBと赤外特徴間の連携されたトランスレーション・スケール・回転ずれを効果的に補正できるか。
  • RQ3一方のモダリティのアノテーションが他方よりも信頼性が高い場合、モダリティ選択の影響はアライメント精度にどのように現れるか。
  • RQ4マルチタスクジッターは、入力不整合の程度が異なる状況下でも、アライメントモジュールのロバスト性を向上させられるか。
  • RQ5提案されたTSRAベースの検出器は、空中RGB-IRオブジェクト検出ベンチマークで最先端の性能を達成できるか。

主な発見

  • TSFADet検出器はDroneVehicleデータセットで73.06%のmAPを達成し、比較されたすべての最先端の単一・マルチモダリティ検出器を上回った。
  • モダリティ選択戦略により、各提案に対して最も正確なリファレンスマダリティを選択することで、ノイズの多いアノテーションからの誤差が顕著に低減され、検出性能が向上した。
  • マルチタスクジッター技術により、トレーニング中に多様な不整合パターンをシミュレートすることで、モデルのロバスト性が向上し、アライメント精度とmAPが向上した。
  • TSRAモジュールは、特に任意のオブジェクトの向き、スケール変動、位置ずれが生じる状況下でのクロスモダリティ不整合の影響を低減した。
  • Cascade R-CNNと組み合わせた場合、TSFADetは73.90%の最高mAPを達成し、優れた一般化性能とスケーラビリティを示した。
  • 単一GPU上で18.6 FPSの高速な推論速度を維持しており、精度面で1段階検出器を上回りながらも、リアルタイム応用に実用的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。