Skip to main content
QUICK REVIEW

[論文レビュー] A novel Multi to Single Module for small object detection

Xiaohui Guo|arXiv (Cornell University)|Mar 27, 2023
Advanced Neural Network Applications被引用数 6
ひとこと要約

本論文は、小物体検出のための新規なマルチツーサングルモジュール(M2S)を提案する。M2Sは、クロススケールアグリゲーションモジュール(CAM)を統合してマルチレベル特徴を融合し、空間的およびチャネルアテンションを組み合わせたデュアルリレーションシップモジュール(DRM)を用いて特徴の精錬を向上させる。YOLOv5sと比較して、VisDrone2021-DETでは検出精度が1.1%向上し、SeaDronesSeeV2では15.68%向上した。

ABSTRACT

Small object detection presents a significant challenge in computer vision and object detection. The performance of small object detectors is often compromised by a lack of pixels and less significant features. This issue stems from information misalignment caused by variations in feature scale and information loss during feature processing. In response to this challenge, this paper proposes a novel the Multi to Single Module (M2S), which enhances a specific layer through improving feature extraction and refining features. Specifically, M2S includes the proposed Cross-scale Aggregation Module (CAM) and explored Dual Relationship Module (DRM) to improve information extraction capabilities and feature refinement effects. Moreover, this paper enhances the accuracy of small object detection by utilizing M2S to generate an additional detection head. The effectiveness of the proposed method is evaluated on two datasets, VisDrone2021-DET and SeaDronesSeeV2. The experimental results demonstrate its improved performance compared with existing methods. Compared to the baseline model (YOLOv5s), M2S improves the accuracy by about 1.1\% on the VisDrone2021-DET testing dataset and 15.68\% on the SeaDronesSeeV2 validation set.

研究の動機と目的

  • 限られたピクセル数と弱い特徴によりモデル性能が低下する小物体検出の課題に対処する。
  • 既存のネットワークにおけるスケール変動に起因する特徴の不整合および情報損失を克服する。
  • マルチスケール特徴の統合とデュアルアテンション機構の活用により、特徴抽出と精錬を向上させる。
  • M2Sモジュールによって強化された専用の検出ヘッドを通じて、小物体の検出精度を向上させる。
  • VisDrone2021-DETおよびSeaDronesSeeV2という2つのベンチマークデータセット上で、M2Sの有効性を検証する。これらは小物体が高密度に存在する。

提案手法

  • バックボーンから得られる五段階の特徴を統合し、三段階の特徴に変換するクロススケールアグリゲーションモジュール(CAM)を提案する。これによりマルチスケール特徴の認識が向上する。
  • 空間的およびチャネルアテンション機構を統合したデュアルリレーションシップモジュール(DRM)を導入し、多段階入力を用いて特徴を精錬する。
  • CAMをバックボーンとネックネットワークの間に埋め込み、特徴ピラミッド処理の前段階で低レベルで高解像度の特徴を強化する。
  • CAMの後にDRMを統合し、デュアルアテンションを用いて集約された三段階の特徴をさらに精錬することで、より豊かな意味的表現を可能にする。
  • 強化された特徴を用いて新しい検出ヘッドを構築し、小物体検出性能を向上させる。
  • マルチインプット・シングルアウトプット設計を採用することで、高解像度の特徴マップを維持しつつ、スケール間の文脈的情報を統合する。

実験結果

リサーチクエスチョン

  • RQ1マルチインプット・シングルアウトプットモジュールは、クロススケール特徴の統合を強化することで、小物体検出のための特徴表現を向上させることができるか?
  • RQ2デュアルアテンションモジュール内で空間的およびチャネルアテンション機構を組み合わせることで、単一アテンション機構よりも優れた特徴精錬が達成できるか?
  • RQ3提案されたM2Sモジュールは、最先端手法と比較して、小物体が高密度に存在するデータセットで顕著な検出精度の向上を達成できるか?
  • RQ4個々のモジュール(CAMおよびDRM)は性能向上にどの程度寄与しており、それらの組み合わせは相乗効果をもたらすか?
  • RQ5M2Sモジュールは、小物体の検出を顕著に向上させる一方で、大規模物体の性能を競争的に維持できるか?

主な発見

  • VisDrone2021-DETのテストセットにおいて、YOLOv5sと比較してM2Sモジュールは平均平均精度(AP)を1.1%向上させた。
  • SeaDronesSeeV2のバリデーションセットでは、YOLOv5sと比較してM2SはAPで15.68%の向上を達成し、小物体が高密度に存在するデータセットでの顕著な向上を示した。
  • アブレーションスタディの結果、CAM単体でAPが0.57%向上、DRM単体で0.73%向上、両者の組み合わせで2.08%向上した。これにより相乗効果が確認された。
  • DRMは他のアテンションモジュールを上回った:CAMと組み合わせた際のAPは19.98で、CBAM(19.34 AP)およびSE(18.60 AP)を上回った。
  • 可視化分析により、M2Sは0.25の信頼度閾値で、ベースラインのYOLOv5sよりも多くの小物体および隠れ物体(波の中のスイマーなど)を検出できた。
  • M2Sは大規模物体についてもYOLOv5sと同等の性能を維持しており、性能向上が小物体検出に特化していることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。