Skip to main content
QUICK REVIEW

[論文レビュー] Task-wise Sampling Convolutions for Arbitrary-Oriented Object Detection in Aerial Images

Zhanchao Huang, Wei Li|arXiv (Cornell University)|Sep 6, 2022
Advanced Neural Network Applications参考文献 64被引用数 5
ひとこと要約

本稿では、方向に敏感な領域からのタスク固有特徴を適応的にサンプリングすることにより、局所化と分類のタスク間における一貫性のない特徴感受性(IFS)を解消する、アーチファクトに依存しないオブジェクト検出のための新規手法であるタスク別サンプリング畳み込み(TS-Conv)を提案する。TS-Convは、タスクに応じたスコアに基づく動的ラベル割り当てを採用し、DIOR-Rで最大+3.94 mAP50:95、SSDD+で最大+19.78の向上を達成し、複数のデータセットで最先端の性能を実現した。

ABSTRACT

Arbitrary-oriented object detection (AOOD) has been widely applied to locate and classify objects with diverse orientations in remote sensing images. However, the inconsistent features for the localization and classification tasks in AOOD models may lead to ambiguity and low-quality object predictions, which constrains the detection performance. In this article, an AOOD method called task-wise sampling convolutions (TS-Conv) is proposed. TS-Conv adaptively samples task-wise features from respective sensitive regions and maps these features together in alignment to guide a dynamic label assignment for better predictions. Specifically, sampling positions of the localization convolution in TS-Conv are supervised by the oriented bounding box (OBB) prediction associated with spatial coordinates, while sampling positions and convolutional kernel of the classification convolution are designed to be adaptively adjusted according to different orientations for improving the orientation robustness of features. Furthermore, a dynamic task-consistent-aware label assignment (DTLA) strategy is developed to select optimal candidate positions and assign labels dynamically according to ranked task-aware scores obtained from TS-Conv. Extensive experiments on several public datasets covering multiple scenes, multimodal images, and multiple categories of objects demonstrate the effectiveness, scalability, and superior performance of the proposed TS-Conv.

研究の動機と目的

  • 多様なオブジェクトの方向性に起因する、任意方向オブジェクト検出(AOOD)における局所化と分類のタスク間の不一致な特徴感受性(IFS)を是正すること。
  • 従来の手法が有する固定受容 field と共有されたサンプリングオフセットの制限を克服し、タスク固有かつ方向に敏感な特徴を捉えること。
  • TS-Convが学習したタスクに応じたスコアに基づき、最適な候補位置を選択する動的でタスクに応じたラベル割り当て戦略を構築すること。
  • 推論コストを増加させることなく、軽量モデルおよびマルチモーダルデータ(例:RGB、SAR、赤外)へのスケーラビリティと耐障害性を確保すること。
  • 特に船舶のような極端なアスペクト比を持つオブジェクトに対して、密な複数方向のリモートセンシングシーンにおける検出精度の向上と誤検出の低減を図ること。

提案手法

  • 局所化と分類のブランチを独立した適応的サンプリング戦略で分離するタスク別サンプリング畳み込み(TS-Conv)を設計する。
  • 局所化のためには、空間座標を用いて方向に敏感な領域に一致するように、オrientedバウンディングボックス(OBB)予測によってサンプリング位置を監視する。
  • 分類のためには、オブジェクトの方向に応じてサンプリング位置と畳み込みカーネルを適応的に調整し、角度にわたる特徴の頑健性を向上させる。
  • TS-Convからのタスクに応じたスコアを用いて候補位置をランク付けし、それに基づいてラベルを割り当てる動的タスクに応じたラベル割り当て(DTLA)メカニズムを導入する。
  • 固定されたカーネル制約なしに空間的および方向的感受性を捉えるために、タスク固有かつ方向に敏感なサンプリングオフセットを有する可変畳み込みを用いる。
  • アンカーレスな検出フレームワークにTS-Convを統合し、効率性を維持しながら特徴の整合性と予測品質を向上させる。

実験結果

リサーチクエスチョン

  • RQ1多様なオブジェクトの方向性下で、任意方向オブジェクト検出における局所化と分類のタスク間の不一致な特徴感受性(IFS)をどのように是正できるか?
  • RQ2タスク固有かつ方向に敏感な特徴サンプリングは、密で複数方向のオブジェクトを有する空中画像における検出精度と頑健性を向上させ得るか?
  • RQ3動的タスクに応じたラベル割り当ては、静的または共有されたサンプリング戦略と比較して、予測品質をどの程度向上させるか?
  • RQ4TS-Convは、追加の推論コストを増加させることなく、RGB、SAR、赤外など異なるデータモダリティおよび軽量アーキテクチャでどの程度の性能を示すか?
  • RQ5明示的な方向に敏感なサンプリングは、標準ベンチマーク全体で誤検出の低減とmAPの向上にどのような影響を与えるか?

主な発見

  • DIOR-Rデータセットでは、ベースラインのGGHLと比較してmAP50:95が3.94ポイント向上し、41.38 mAP50:95を達成した。
  • SSDD+ SARデータセットでは、ベースラインのGGHLと比較してmAP75が19.78ポイント向上し、41.96 mAP75を達成した。
  • HRSC2016では、mAP50:95が80.81に達し、ベースラインのGGHLを2.27ポイント上回った。
  • 本手法は強力な汎化性能を示し、RGB、赤外、SAR、パンクロマチック画像を含む複数のデータセットで最先端の性能を達成した。
  • TS-Convは高い効率性とスケーラビリティを維持しており、推論コストを増加させることなく、MobileNetV2のような軽量モデルの性能を向上させた。
  • 可視化結果から、TS-Convは誤検出を低減し、特に極端なアスペクト比を持つ船舶に対してより正確な方向に敏感なバウンディングボックスを生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。