Skip to main content
QUICK REVIEW

[論文レビュー] CBNet: A Novel Composite Backbone Network Architecture for Object Detection

Yudong Liu, Yongtao Wang|arXiv (Cornell University)|Sep 9, 2019
Advanced Neural Network Applications被引用数 13
ひとこと要約

本論文では、ResNeXtなどの同一バックボーンを合成接続を介して連結することで、高レベル特徴を次のバックボーンにフィードバックする仕組みを用いて、オブジェクト検出性能を向上させる新規アーキテクチャ「コンpositeバックボーンネットワーク(CBNet)」を提案する。Cascade Mask R-CNNなどの最先端検出器にCBNetを統合することで、単一モデルでCOCO上で53.3のSOTA mAPを達成し、複数の検出器において1.5–3.0パーセンテージポイントのmAP向上を実現した。

ABSTRACT

In existing CNN based detectors, the backbone network is a very important component for basic feature extraction, and the performance of the detectors highly depends on it. In this paper, we aim to achieve better detection performance by building a more powerful backbone from existing backbones like ResNet and ResNeXt. Specifically, we propose a novel strategy for assembling multiple identical backbones by composite connections between the adjacent backbones, to form a more powerful backbone named Composite Backbone Network (CBNet). In this way, CBNet iteratively feeds the output features of the previous backbone, namely high-level features, as part of input features to the succeeding backbone, in a stage-by-stage fashion, and finally the feature maps of the last backbone (named Lead Backbone) are used for object detection. We show that CBNet can be very easily integrated into most state-of-the-art detectors and significantly improve their performances. For example, it boosts the mAP of FPN, Mask R-CNN and Cascade R-CNN on the COCO dataset by about 1.5 to 3.0 percent. Meanwhile, experimental results show that the instance segmentation results can also be improved. Specially, by simply integrating the proposed CBNet into the baseline detector Cascade Mask R-CNN, we achieve a new state-of-the-art result on COCO dataset (mAP of 53.3) with single model, which demonstrates great effectiveness of the proposed CBNet architecture. Code will be made available on https://github.com/PKUbahuangliuhe/CBNet.

研究の動機と目的

  • 既存のバックボーンネットワークの表現能力を向上させることで、オブジェクト検出性能を向上させること。
  • 元々画像分類を目的として設計された単一バックボーンの、オブジェクト検出に最適な特徴抽出における限界を解消すること。
  • 新規に深層バックボーンをからくりから訓練するのではなく、即座に利用可能な代替手段としてのコスト効率の高い手法を開発すること。
  • 検出器全体の再訓練やImageNetにおける新たな事前学習を必要とせずに、顕著な性能向上を実現すること。

提案手法

  • CBNetは、アシスタントバックボーンとリードバックボーンを含む、複数の同一バックボーンを積み重ねることでコンポジットバックボーンを構築する。
  • 隣接するバックボーンの並列段階の間に合成接続を導入し、1つのバックボーンの高レベル特徴を次のバックボーンの入力として供給する。
  • 最終的なバックボーン(リードバックボーン)の特徴マップを、検出ヘッド、FPN、RPNの主な入力として使用する。
  • 追加の事前学習は不要で、各バックボーンは公開済みのImageNet事前学習モデルで初期化される。
  • アシスタントバックボーンの初期段階を削除することで、計算コストを低減しつつ精度を維持する、加速版のCBNetを提案する。
  • FPN、Mask R-CNN、Cascade R-CNNなどの既存の検出器と互換性があり、即座に統合可能なプラグアンドプレイ型である。

実験結果

リサーチクエスチョン

  • RQ1段階間の特徴伝達を伴う複数の同一バックボーンの積み重ねは、単一バックボーンに比べてオブジェクト検出性能をさらに向上させることができるか?
  • RQ2標準の分類指向バックボーンと比較して、合成接続機構は検出タスクのための特徴表現を効果的に向上させることができるか?
  • RQ3CBNetは、COCOベンチマークにおける複数の最先端検出器において、どの程度mAPを向上させるか?
  • RQ4新たな事前学習やアーキテクチャの再設計を必要とせずに、CBNetはSOTA性能を達成できるか?
  • RQ5CBNetにおけるバックボーンの数は、検出精度と推論速度にどのように影響を与えるか?

主な発見

  • CBNetは、FPN、Mask R-CNN、Cascade R-CNNのCOCOにおけるmAPを1.5~3.0パーセンテージポイント向上させた。
  • Cascade Mask R-CNNに統合した場合、CBNetは単一モデルでCOCOで53.3のSOTA mAPを達成した。
  • バックボーンの数が増えるにつれて検出mAPは徐々に上昇し、3つのバックボーンで収束することが示され、トリプルバックボーンアーキテクチャが最適性能を示した。
  • 加速版CBNet(K=2)は、推論速度を5.5 fpsから6.9 fpsに向上させたが、元のmAPから0.2ポイント以内の精度を維持した。
  • 可視化結果から、CBNetはより代表的な特徴を抽出しており、前景オブジェクトに強く活性化され、背景には弱く活性化されていることが確認された。
  • 合成接続機構により、複数のバックボーン間で高レベルと低レベルの特徴が効果的に統合され、特徴の識別性が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。