Skip to main content
QUICK REVIEW

[論文レビュー] Learning to decompose for object detection and instance segmentation

Eunbyung Park, Alexander C. Berg|arXiv (Cornell University)|Nov 19, 2015
Advanced Neural Network Applications参考文献 25被引用数 18
ひとこと要約

本論文では、畳み込み層と再帰層を組み合わせたエンド・ツー・エンドで学習可能な深層ニューラルネットワーク、DecompNetを提案する。このネットワークは、1回の順方向伝搬で可変長の出力を生成し、領域提案や非最大抑制を不要にする。マスクベースの損失関数を用いることで、インスタンス数と正確な局所化を同時に予測する。合成MNISTディジットでは最先端の性能を達成し、KITTIの車両検出でも有望な結果を示す。

ABSTRACT

Although deep convolutional neural networks(CNNs) have achieved remarkable results on object detection and segmentation, pre- and post-processing steps such as region proposals and non-maximum suppression(NMS), have been required. These steps result in high computational complexity and sensitivity to hyperparameters, e.g. thresholds for NMS. In this work, we propose a novel end-to-end trainable deep neural network architecture, which consists of convolutional and recurrent layers, that generates the correct number of object instances and their bounding boxes (or segmentation masks) given an image, using only a single network evaluation without any pre- or post-processing steps. We have tested on detecting digits in multi-digit images synthesized using MNIST, automatically segmenting digits in these images, and detecting cars in the KITTI benchmark dataset. The proposed approach outperforms a strong CNN baseline on the synthesized digits datasets and shows promising results on KITTI car detection.

研究の動機と目的

  • 領域提案や非最大抑制に依存する従来のオブジェクト検出パイプラインの高い計算コストとハイパーパrameterへの感受性を解消すること。
  • 可変数のオブジェクトインスタンスを境界ボックスまたはセグメンテーションマスクで予測できる統合的でエンド・ツー・エンドで学習可能なアーキテクチャの開発。
  • 事前処理や後処理ステップなしに、オブジェクト数と正確な空間的局所化を同時に予測可能にする。
  • 新しいマスクベースの損失関数を用いて、多クラス・マルチオブジェクト検出およびインスタンスセグメンテーションの学習安定性と性能を向上させる。

提案手法

  • 各オブジェクトクラスごとにカテゴリ特化の応答マップを生成するため、畳み込みニューラルネットワーク(CNN)を用いる。
  • 各応答マップを再帰ネットワークに供給し、1インスタンスずつ個別のインスタンスマップを段階的に出力する。
  • 再帰ネットワークを、局所的な空間グリッドではなく、全体の応答マップに注目させるように設計し、グローバルな文脈認識を可能にする。
  • インスタンス総数と各インスタンスの正確な空間的局所化の両方を同時に最適化する、新しいマスクベースの損失関数を導入する。
  • バックプロパゲーションを用いて、ネットワーク全体をエンド・ツー・エンドで学習させ、再帰モジュールが重なったり密集したオブジェクト応答をどのように分解すべきかを暗黙的に学習できるようにする。
  • 各検出インスタンスに対して高解像度のマスクマップを回帰することで、検出とインスタンスセグメンテーションの両タスクに同じアーキテクチャを適用する。

実験結果

リサーチクエスチョン

  • RQ1深層学習モデルは、領域提案や非最大抑制に依存せずに、可変数のオブジェクトインスタンスを生成できるか?
  • RQ2再帰ネットワークは、エンド・ツー・エンドで学習可能な形で、1つのカテゴリ応答マップを複数の個別インスタンスマップに効果的に分解できるか?
  • RQ3インスタンス数と空間的局所化の両方を同時に最適化する新しいマスクベースの損失関数は、検出およびセグメンテーションの性能を向上させるか?
  • RQ4提案されたアーキテクチャは複数のオブジェクトカテゴリに一般化可能で、変動するオブジェクトスケールや密度に対応できるか?
  • RQ5このエンド・ツー・エンドアプローチの性能は、強力なCNNベースラインや2段階検出器と比較して、合成データおよび実世界のベンチマークでどうなるか?

主な発見

  • 合成マルチディジットMNISTデータセットにおいて、強力なCNNベースラインを上回り、ディジット '3'、'6'、'9' の検出精度が優れている。
  • KITTIベンチマークにおける車両検出でも、アーキテクチャの変更なしに競争力ある性能を示し、実世界データへの一般化を確認した。
  • 提案されたマスクベースの損失関数により、インスタンス数と空間的局所化の正確な同時予測が可能になり、学習安定性と出力品質が向上した。
  • 再帰的分解機構は、密集または重なったオブジェクトの状況でも、個々のインスタンスを効果的に特定・分離できた。
  • 合成ディジットデータセットでは最先端の結果を達成し、同じタスクにおいて2段階検出器と同等またはそれ以上の性能を示した。
  • この手法はインスタンスセグメンテーションにも一般化可能であり、後処理なしに高解像度のマスクマップを生成し、各オブジェクトインスタンスを正確に局所化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。