Skip to main content
QUICK REVIEW

[論文レビュー] ILNet: Low-level Matters for Salient Infrared Small Target Detection

Haoqing Li, Jinfu Yang|arXiv (Cornell University)|Sep 24, 2023
Infrared Target Detection Methodologies被引用数 4
ひとこと要約

本稿では、インタラクティブな偏光直交融合(IPOF)モジュールと代表的ブロック(RB)を導入することで低レベル特徴を優先する、赤外小目標検出のための新規ディーブラーニングフレームワークILNetを提案する。DODA層による動的特徴統合と高分解能の低レベル特徴の保持により、NUAA-SIRST(78.22% nIoU、1.33×10⁻⁶ Fa)およびIRSTD-1K(68.91% nIoU、3.23×10⁻⁶ Fa)で最先端性能を達成し、データ量の増加に伴う優れたロバストネスを示している。

ABSTRACT

Infrared small target detection is a technique for finding small targets from infrared clutter background. Due to the dearth of high-level semantic information, small infrared target features are weakened in the deep layers of the CNN, which underachieves the CNN's representation ability. To address the above problem, in this paper, we propose an infrared low-level network (ILNet) that considers infrared small targets as salient areas with little semantic information. Unlike other SOTA methods, ILNet pays greater attention to low-level information instead of treating them equally. A new lightweight feature fusion module, named Interactive Polarized Orthogonal Fusion module (IPOF), is proposed, which integrates more important low-level features from the shallow layers into the deep layers. A Dynamic One-Dimensional Aggregation layers (DODA) are inserted into the IPOF, to dynamically adjust the aggregation of low dimensional information according to the number of input channels. In addition, the idea of ensemble learning is used to design a Representative Block (RB) to dynamically allocate weights for shallow and deep layers. Experimental results on the challenging NUAA-SIRST (78.22% nIoU and 1.33e-6 Fa) and IRSTD-1K (68.91% nIoU and 3.23e-6 Fa) dataset demonstrate that the proposed ILNet can get better performances than other SOTA methods. Moreover, ILNet can obtain a greater improvement with the increasement of data volume. Training code are available at https://github.com/Li-Haoqing/ILNet.

研究の動機と目的

  • 畳み込みニューラルネットワーク(CNN)における深層部の特徴の喪失、特に小規模な赤外ターゲットが高レベル特徴が不足するため、意味的情報を失う問題に対処する。
  • 小規模な赤外ターゲットを最小限の意味的コンテンツを持つ顕著領域と再考することで、検出性能を向上させる。
  • 浅い層からの低レベル特徴を優先し、それを効果的に深層デコーダーステージに統合することで、特徴統合を強化する。
  • DODAおよびRBブロックによる動的・適応的特徴統合により、誤検出および見逃し検出を低減する。
  • 訓練データ量の増加に伴う汎化性能の向上を示し、モデルのスケーラビリティとロバストネスを強調する。

提案手法

  • インタラクティブな偏光直交融合(IPOF)モジュールは、高分解能の低レベル特徴を保持し、直交アテンションを用いて深層特徴と融合することで、エンコーダーとデコーダー間の双方向特徴統合を可能にする。
  • IPOFに動的1次元集約(DODA)層を統合し、入力チャネル数に応じて特徴統合を動的に調整することで、低次元特徴の表現を向上させる。
  • 代表的ブロック(RB)はアンサンブル学習を用いて、浅い特徴と深い特徴の間で注意重みを動的に割り当て、特徴統合を強化し、深層部の特徴喪失を緩和する。
  • IPOFは内部解像度を高めることで、ダウンサンプリング中の情報損失を最小限に抑え、小目標特徴がネットワーク全体で保持されることを保証する。
  • RBブロックは、浅い特徴を用いて深い層の表現をガイドする新規な特徴強化戦略を採用し、バイリニアや最近傍補間といった標準的なアップサンプリング手法を上回る性能を発揮する。
  • ネットワーク全体はセグメンテーションベースの損失関数を用いてエンドツーエンドで学習され、赤外小目標検出を顕著オブジェクト検出タスクとして扱う。

実験結果

リサーチクエスチョン

  • RQ1CNNベースのネットワークにおいて低レベル特徴を優先することで、意味的コンテンツが最小限の赤外小目標の検出性能を顕著に向上させることができるか?
  • RQ2DODA層による動的特徴統合は、深層部の低次元特徴の表現にどのように影響を与えるか?
  • RQ3動的重み割り当てを備えた代表的ブロック(RB)は、深層部の特徴喪失をどれほど軽減し、検出精度を向上させるか?
  • RQ4IPOFモジュールは、標準的なスキップ接続や特徴統合モジュールと比較して、小目標の詳細をどれほど効果的に保持できるか?
  • RQ5ILNetは、訓練データ量の増加に伴い、改善された汎化性能とスケーラビリティを示すか?

主な発見

  • NUAA-SIRSTデータセットでは、ILNetが78.22% nIoUおよび1.33×10⁻⁶ Faを達成し、比較したすべてのSOTA手法を上回った。
  • IRSTD-1Kデータセットでは、ILNetが68.91% nIoUおよび3.23×10⁻⁶ Faを達成し、ベンチマーク全体で一貫した優位性を示した。
  • アブレーションスタディの結果、IPOFとRBの組み合わせが最良の性能(78.12% IoU、76.42% nIoU、5.50 Fa)を発揮し、両者の相乗効果を実証した。
  • DODAを統合したIPOFモジュールは、ベースラインと比較して誤検出を45.5%低減した。これは、ノイズ抑制における有効性を示している。
  • 浅い特徴から深い特徴への強化戦略を採用したRBブロックは、誤検出を7.76 Faまで低減し、バイリニア(10.25 Fa)やCarafe(8.87 Fa)といった標準的なアップサンプリング手法を著しく上回った。
  • ILNetはデータ量の増加に伴い、より顕著な性能向上を示し、強力なスケーラビリティと将来のデータ駆動型向上の可能性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。