Skip to main content
QUICK REVIEW

[論文レビュー] Triply Supervised Decoder Networks for Joint Detection and Segmentation

Jiale Cao, Yanwei Pang|arXiv (Cornell University)|Sep 25, 2018
Advanced Neural Network Applications参考文献 42被引用数 4
ひとこと要約

本稿では、各デコーダ層に検出指向の監視、クラスに依存するセマンティックセグメンテーション、およびクラスに依存しないセグメンテーションの3つの監視を適用することで、オブジェクト検出とセマンティックセグメンテーションを同時に実行する、完全畳み込みネットワークであるTripleNetを提案する。軽量モジュール(内接接続モジュールおよびアテンションスイープレイヤーフュージョン)を用いることで特徴の学習を強化し、推論時の計算コストを増加させることなく、VOC2007およびVOC2012で最先端の性能を達成した。

ABSTRACT

Joint object detection and semantic segmentation can be applied to many fields, such as self-driving cars and unmanned surface vessels. An initial and important progress towards this goal has been achieved by simply sharing the deep convolutional features for the two tasks. However, this simple scheme is unable to make full use of the fact that detection and segmentation are mutually beneficial. To overcome this drawback, we propose a framework called TripleNet where triple supervisions including detection-oriented supervision, class-aware segmentation supervision, and class-agnostic segmentation supervision are imposed on each layer of the decoder network. Class-agnostic segmentation supervision provides an objectness prior knowledge for both semantic segmentation and object detection. Besides the three types of supervisions, two light-weight modules (i.e., inner-connected module and attention skip-layer fusion) are also incorporated into each layer of the decoder. In the proposed framework, detection and segmentation can sufficiently boost each other. Moreover, class-agnostic and class-aware segmentation on each decoder layer are not performed at the test stage. Therefore, no extra computational costs are introduced at the test stage. Experimental results on the VOC2007 and VOC2012 datasets demonstrate that the proposed TripleNet is able to improve both the detection and segmentation accuracies without adding extra computational costs.

研究の動機と目的

  • 既存の統合学習フレームワークにおけるオブジェクト検出とセマンティックセグメンテーションの間の相互利益が限定的であるという問題に取り組む。
  • 補完的な監視信号を活用することで、検出およびセグメンテーションの両タスクの性能を向上させる。
  • マルチタスク監視にもかかわらず、追加の推論コストを生じさせない軽量アーキテクチャを設計する。
  • クラスに依存しないセグメンテーションが、検出およびセグメンテーションの両タスクにおける事前知識として有効であるかを検証する。

提案手法

  • 各デコーダ層に検出指向の監視、クラスに依存するセグメンテーション、およびクラスに依存しないセグメンテーションの3種類の監視を課すことにより、特徴表現を強化する。
  • チャネル間の特徴を接続することで、各デコーダ層内の特徴学習を強化する内接接続モジュールを導入する。
  • エンコーダとデコーダのパスからの特徴を動的に重み付けして統合するアテンションベースのスイープレイヤーフュージョンを採用し、特徴の質を向上させる。
  • 各層が異なるスケールのオブジェクトを予測できるマルチスケールデコーダアーキテクチャを採用し、マルチスケール検出を可能にする。
  • クラスに依存しないセグメンテーション監視を、検出およびセグメンテーションの両タスクをガイドする事前知識として適用し、オブジェクト性推定を向上させる。
  • クラスに依存するセグメンテーションおよびクラスに依存しないセグメンテーションは訓練時のみに実行し、推論時にはこれらのモジュールを削除することで計算オーバーヘッドを回避する。

実験結果

リサーチクエスチョン

  • RQ1検出とセグメンテーションの両タスクにまたがる統合的監視が、両タスクの性能を同時に向上させることができるか?
  • RQ2クラスに依存しないセグメンテーション監視が、検出およびセグメンテーションの精度向上に有用な事前知識として機能するか?
  • RQ3内接接続モジュールやアテンションベースのスイープレイヤーフュージョンといった軽量モジュールが、推論コストを増加させることなく特徴学習を向上させることができるか?
  • RQ4推論時の計算コストを追加せずに、検出およびセグメンテーションの両タスクで最先端の性能を達成することは可能か?
  • RQ5提案されたTripleNetは、既存の検出・セグメンテーション統合手法と比較して、精度および効率の面でどのように優れているか?

主な発見

  • TripleNetはVOC2007のテストセットでmAP 82.7%を達成し、SSD、DSSD、BlitzNetを含むすべての最先端手法を上回った。
  • VOC2012データセットでは、mIoU 82.9%を達成し、BlitzNetを7.3ポイント以上上回った。
  • BlitzNetと比較して、検出のmAPは2.0%向上、セグメンテーションのmIoUは7.3%向上を達成し、顕著な性能向上を示した。
  • 提案されたTripleNetは、推論時の追加計算コストなしに、検出およびセグメンテーションの両タスクで最先端の性能を達成した。
  • アブレーションスタディの結果、クラスに依存しないセグメンテーション監視が性能向上に顕著に寄与しており、特にオブジェクト検出において顕著であった。
  • アテンションスイープレイヤーフュージョンおよび内接接続モジュールは、両データセットにおけるアブレーション結果から、特徴表現の向上に寄与していることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。