Skip to main content
QUICK REVIEW

[論文レビュー] Single-Shot Object Detection with Enriched Semantics

Zhishuai Zhang, Siyuan Qiao|arXiv (Cornell University)|Dec 1, 2017
Advanced Neural Network Applications参考文献 20被引用数 14
ひとこと要約

本稿では、弱教師付きセマンティックセグメンテーションブランチとグローバルアクティベーションモジュールを介して特徴マップの意味的意味を強化することで、意味的意味を豊かにした単一スホットオブジェクト検出器であるDetection with Enriched Semantics (DES)を提案する。クラスに依存するセマンティック特徴を低レベルの検出特徴に統合し、自己教師付きでチャネル-オブジェクト関係を学習することで、DESはVOC2007で81.7のmAP、COCOで32.8のmAPを達成し、Titan Xp GPUで1枚あたり31.5msの推論速度を実現した。

ABSTRACT

We propose a novel single shot object detection network named Detection with Enriched Semantics (DES). Our motivation is to enrich the semantics of object detection features within a typical deep detector, by a semantic segmentation branch and a global activation module. The segmentation branch is supervised by weak segmentation ground-truth, i.e., no extra annotation is required. In conjunction with that, we employ a global activation module which learns relationship between channels and object classes in a self-supervised manner. Comprehensive experimental results on both PASCAL VOC and MS COCO detection datasets demonstrate the effectiveness of the proposed method. In particular, with a VGG16 based DES, we achieve an mAP of 81.7 on VOC2007 test and an mAP of 32.8 on COCO test-dev with an inference speed of 31.5 milliseconds per image on a Titan Xp GPU. With a lower resolution version, we achieve an mAP of 79.7 on VOC2007 with an inference speed of 13.0 milliseconds per image.

研究の動機と目的

  • 深層特徴マップにおける意味的理解の向上を通じて、単一スホットオブジェクト検出を改善すること。
  • 小サイズオブジェクト検出と特徴品質に悪影響を及げる、低レベル検出特徴の意味的豊かさの欠如を是正すること。
  • 密なセグメンテーションアノテーションを必要とせずに意味的意味を豊かにする手法を導入すること。
  • 検出精度を向上させつつも、高い推論速度を維持すること。
  • 軽量でモジュラーな設計により、既存の検出器と互換性を持つ効果的な意味的特徴統合を可能とすること。

提案手法

  • バウンディングボックスレベルの弱教師付き监督を用いて、低レベル検出特徴にクラスに依存するセマンティック特徴を生成するセグメンテーションブランチを導入する。
  • グローバルアクティベーションモジュールを介してチャネル単位のアテンション機構を適用し、高レベル特徴におけるチャネル間およびオブジェクトクラス関係を学習する。
  • 要素ごとの乗算により意味的意味を豊かにした特徴マップを生成するため、セマンティック特徴と元の検出特徴を統合する。
  • バックボーンにVGG16を採用し、セグメンテーションブランチを最初の検出層(conv4_3)に統合し、グローバルアクティベーションモジュールをすべての検出層に設置する。
  • 追加のアノテーションなしでグローバルな文脈を捉えるために、グローバルアクティベーションモジュールで自己教師付き学習を実施する。
  • セグメンテーションブランチとグローバルアクティベーションモジュールの2つのコンponentsのみを追加することで、SSDスタイルの1段階検出器と互換性を保つ。

実験結果

リサーチクエスチョン

  • RQ1弱教師付きセマンティックセグメンテーションは、単一スホットオブジェクト検出器の特徴の意味的意味を向上させることができるか?
  • RQ2低レベル検出特徴と意味的特徴を統合することで、特に小サイズオブジェクトに対して検出性能が向上するか?
  • RQ3追加のアノテーションなしで、自己教師付きグローバルアクティベーションモジュールが高レベル特徴表現を向上させることができるか?
  • RQ4従来の1段階検出器(SSD や R-FCN)と比較して、提案手法の精度と速度はどの程度か?
  • RQ5主なアーキテクチャ変更なしに、標準的な検出フレームワークに効果的に適用可能か?

主な発見

  • VOC2007テストで81.7のmAPを達成し、R-FCN やResNetベースのSSDといった従来のSOTA手法を上回った。
  • MS COCOテストデブで32.8のmAPを達成し、大規模で複雑なデータセットへの強力な一般化能力を示した。
  • VGG16バックボーンを用いたDESは、Titan Xp GPUで1枚あたり31.5ms(31.7 FPS)で画像を処理した。
  • 低解像度版のDES(DES300)は1枚あたり13.0ms(76.8 FPS)で動作し、VOC2007でmAP 79.7を達成した。
  • アブレーションスタディの結果、セグメンテーションブランチとアクティベーション機構が不可欠であることが確認され、これらを削除するとmAPが77.6に低下した。
  • SSD や R-FCN と比較して、精度では優れており、特に深層バックボーンモデルと比較しても競争力のある速度を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。