Skip to main content
QUICK REVIEW

[論文レビュー] ssFPN: Scale Sequence (S^2) Feature Based-Feature Pyramid Network for Object Detection

Hye-Jin Park, Youngju Choi|arXiv (Cornell University)|Aug 24, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、スケール不変特徴を抽出するために、FPNのレベル軸に沿って3次元畳み込みを適用するスケールシーケンス(S²)特徴ピラミッドネットワークであるssFPNを提案する。FPNのレベルを時系列的なシーケンスとして扱うことで、レベル間の相関関係を捉え、高解像度特徴マップを強化し、Faster R-CNNでは小サイズ物体で最大2.0%、YOLOv4-P5では1.3%のAP向上を達成した。

ABSTRACT

Feature Pyramid Network (FPN) has been an essential module for object detection models to consider various scales of an object. However, average precision (AP) on small objects is relatively lower than AP on medium and large objects. The reason is why the deeper layer of CNN causes information loss as feature extraction level. We propose a new scale sequence (S^2) feature extraction of FPN to strengthen feature information of small objects. We consider FPN structure as scale-space and extract scale sequence (S^2) feature by 3D convolution on the level axis of FPN. It is basically scale invariant feature and is built on high-resolution pyramid feature map for small objects. Furthermore, the proposed S^2 feature can be extended to most object detection models based on FPN. We demonstrate the proposed S2 feature can improve the performance of both one-stage and two-stage detectors on MS COCO dataset. Based on the proposed S2 feature, we achieve upto 1.3% and 1.1% of AP improvement for YOLOv4-P5 and YOLOv4-P6, respectively. For Faster RCNN and Mask R-CNN, we observe upto 2.0% and 1.6% of AP improvement with the suggested S^2 feature, respectively.

研究の動機と目的

  • 物体検出モデルにおける小物体の平均精度(AP)が低いままであるという継続的な課題に対処すること。
  • 深層畳み込みニューラルネットワークのより深い層で生じる特徴の劣化や情報損失が、特に小物体の特徴に顕著に影響を及える問題を克服すること。
  • FPN特徴ピラミッド内のレベル間相関を活用することで、あらゆる物体スケールにおける特徴表現を向上させること。
  • FPNに基づく1段階および2段階検出器の両方と互換性がある、即挿し可能なモジュールを設計すること。

提案手法

  • FPNのレベル軸を時間的次元として扱い、2次元特徴マップをレベルに跨る3次元テンソルに変換してシーケンスモデリングを実現する。
  • 3次元畳み込みを適用して、スケール不変性を内蔵し、複数レベルのコンテキストを捉えるスケールシーケンス(S²)特徴を抽出する。
  • すべてのFPN特徴マップを共通の高解像度にリサイズして、一貫した3次元畳み込みの入力とし、小物体の表現を強化する。
  • 抽出されたS²特徴を、検出ヘッドの推論前に高解像度特徴マップ(例:P3)に連結する。
  • 2段階検出器にS²特徴を統合する際、チャネル次元を調整するために1×1畳み込みを用いる。
  • S²モジュールを、アーキテクチャの大規模な見直しが不要な大多数のFPNベースの物体検出器に容易に拡張可能に設計する。

実験結果

リサーチクエスチョン

  • RQ1FPNのレベル軸をシーケンスとしてモデル化することで、小物体の特徴表現が向上するか?
  • RQ2FPNのレベル間で相関関係を捉えることで、あらゆるスケールで検出性能が向上するか?
  • RQ33次元畳み込みに基づくS²特徴抽出機構は、物体検出におけるスケール不変性を向上させられるか?
  • RQ4S²特徴は、1段階および2段階の多様な検出器アーキテクチャにおいて、どのように性能を発揮するか?
  • RQ5S²特徴を既存のFPNベースの検出器に統合する際の推論効率とパラメータオーバーヘッドはどの程度か?

主な発見

  • 提案されたS²特徴により、YOLOv4-P5では小物体のAPが最大1.3%向上し、YOLOv4-P6では1.1%向上した。
  • Faster R-CNNおよびMask R-CNNでは、それぞれ2.0%および1.6%のAP向上を達成し、特に小物体で最大の向上を示した。
  • YOLOv4-P6にS²特徴を適用した場合、小物体で最大のAP向上(1.1%)を示し、中サイズ(0.3%)、大サイズ(0.4%)でも向上が確認された。
  • アブレーションスタディの結果、S²特徴をP3に連結した場合が最も高い性能を示し、計算コストの増加も最小限に抑えられた。
  • 実行時間解析の結果、V100上でバッチサイズ8で推論速度はわずか1.7msから8.9msに低下したことが判明し、推論コストが低いことが確認された。
  • S²特徴はすべてのモデルでAP50およびAP75を向上させ、検出のロバストネスが一貫して向上していることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。