Skip to main content
QUICK REVIEW

[論文レビュー] HIC-YOLOv5: Improved YOLOv5 For Small Object Detection

Shiyi Tang, Shu Zhang|arXiv (Cornell University)|Sep 28, 2023
Advanced Neural Network Applications被引用数 5
ひとこと要約

HIC-YOLOv5 は、高解像度特徴マップ用の専用小物体検出ヘッド(SODH)、バックボーンとネック間でのチャネル情報強化のための非回転ブロック、およびバックボーン端に設けた軽量 CBAM 注目モジュールを導入することで、小物体検出に最適化された YOLOv5 モデルを提案する。本手法は、先行の注目メカニズムベースの手法と比較して計算コストを低減しつつ、VisDrone-2019-DET データセットで mAP@[.5:.95] に 6.42% の絶対的向上、mAP@0.5 に 9.38% の向上を達成した。

ABSTRACT

Small object detection has been a challenging problem in the field of object detection. There has been some works that proposes improvements for this task, such as adding several attention blocks or changing the whole structure of feature fusion networks. However, the computation cost of these models is large, which makes deploying a real-time object detection system unfeasible, while leaving room for improvement. To this end, an improved YOLOv5 model: HIC-YOLOv5 is proposed to address the aforementioned problems. Firstly, an additional prediction head specific to small objects is added to provide a higher-resolution feature map for better prediction. Secondly, an involution block is adopted between the backbone and neck to increase channel information of the feature map. Moreover, an attention mechanism named CBAM is applied at the end of the backbone, thus not only decreasing the computation cost compared with previous works but also emphasizing the important information in both channel and spatial domain. Our result shows that HIC-YOLOv5 has improved mAP@[.5:.95] by 6.42% and mAP@0.5 by 9.38% on VisDrone-2019-DET dataset.

研究の動機と目的

  • 高高度からの撮影による小物体の微小化に起因する、無人航空機(UAV)ベースの画像における小物体検出の課題に対処すること。
  • 低解像度特徴マップと不十分なチャネル表現による YOLOv5 の小物体・極小物体検出性能の限界を克服すること。
  • 既存の注目メカニズムベースや構造的変更手法と比較して、計算コストを低減しつつ検出精度を向上させること。
  • アーキテクチャの複雑さとパラメータ増加を最小限に抑えることで、リアルタイム推論性能を維持すること。

提案手法

  • 高解像度特徴マップを処理する専用の小物体検出ヘッド(SODH)を導入し、極小・小物体の局所化および分類性能を向上させる。
  • バックボディとネックの間に非回転ブロックを挿入することで、チャネル間の特徴相互作用を強化し、パラメータの増加を抑えつつチャネルワイズ表現を豊かにする。
  • バックボディの終端に軽量な CBAM 注目モジュールを適用し、重要な空間的およびチャネル的特徴を強調することで、余分な計算を低減する。
  • 小物体検出における頑健性と一般化性能を向上させるために、センタークロップを含むデータ拡張技術を用いる。
  • SODH、非回転ブロック、および CBAM を YOLOv5-6.0 アーキテクチャに統合し、リアルタイム推論性能を保持したまま HIC-YOLOv5 を構築する。
Figure 1: Structure of YOLOv5-6.0.
Figure 1: Structure of YOLOv5-6.0.

実験結果

リサーチクエスチョン

  • RQ1YOLOv5 における小物体検出性能を向上させるために、高解像度予測ヘッドを専用に設けることは有効か?
  • RQ2バックボディとネックの間に非回転ブロックを導入することで、計算コストを増加させることなく、小物体検出に適した特徴表現が向上するか?
  • RQ3重い注目メカニズム(例:トランスフォーマー)と比較して、軽量な CBAM 注目モジュールが小物体検出において優れた性能を発揮し、推論負荷を低減できるか?
  • RQ4SODH、非回転ブロック、CBAM の各構成要素が、VisDrone-2019-DET データセットにおける全体の mAP 向上にどの程度寄与しているか?

主な発見

  • HIC-YOLOv5 は、YOLOv5s と比較して、VisDrone-2019-DET テストセットで mAP@[.5:.95] に 6.42% の絶対的向上、mAP@0.5 に 9.38% の向上を達成した。
  • SODH の追加のみで、mAP@.5 が 8.31% 向上、mAP@[.5:.95] が 5.51% 向上し、その主導的寄与が示された。
  • SODH と組み合わせた非回転ブロックは、mAP@.5 に 0.66%、mAP@[.5:.95] に 0.57% の追加向上をもたらした。
  • CBAM は mAP@.5 に 0.41%、mAP@[.5:.95] に 0.34% の向上をもたらし、低コストで特徴の精錬が有効であることを示した。
  • アブレーションスタディにより、SODH が存在しないと、CBAM や非回転ブロック単体では不十分であることが確認され、マルチスケール特徴の活用の必要性が強調された。
  • 先行の注目メカニズムベースのモデル(例:Wang et al. [11])と比較して、HIC-YOLOv5 はモデルパラメータと勾配を削減し、8.39M パラメータ(対象:14.58M)を達成した。これにより、計算コストの低減が確認された。
Figure 2: FPN and PANet structure in YOLOv5.
Figure 2: FPN and PANet structure in YOLOv5.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。