Skip to main content
QUICK REVIEW

[論文レビュー] DeepEdge: A Multi-Scale Bifurcated Deep Network for Top-Down Contour Detection

Gedas Bertasius, Jianbo Shi|arXiv (Cornell University)|Dec 2, 2014
Medical Image Segmentation Techniques参考文献 32被引用数 13
ひとこと要約

DeepEdgeは、深層ネットワーク(KNet)で事前学習されたオブジェクトレベルの特徴を活用して、低レベルのホッソリ検出を向上させる、トップダウンでマルチスケールなディープラーニングアプローチを提案する。分岐型の全結合サブネットワークを用い、分離された分類および回帰ヘッドを最適化することで、エッジの再現率と正確性の両方を向上させ、BSDS500で平均精度0.81、Fスコア0.77という最先端の性能を達成した。

ABSTRACT

Contour detection has been a fundamental component in many image segmentation and object detection systems. Most previous work utilizes low-level features such as texture or saliency to detect contours and then use them as cues for a higher-level task such as object detection. However, we claim that recognizing objects and predicting contours are two mutually related tasks. Contrary to traditional approaches, we show that we can invert the commonly established pipeline: instead of detecting contours with low-level cues for a higher-level recognition task, we exploit object-related features as high-level cues for contour detection. We achieve this goal by means of a multi-scale deep network that consists of five convolutional layers and a bifurcated fully-connected sub-network. The section from the input layer to the fifth convolutional layer is fixed and directly lifted from a pre-trained network optimized over a large-scale object classification task. This section of the network is applied to four different scales of the image input. These four parallel and identical streams are then attached to a bifurcated sub-network consisting of two independently-trained branches. One branch learns to predict the contour likelihood (with a classification objective) whereas the other branch is trained to learn the fraction of human labelers agreeing about the contour presence at a given point (with a regression criterion). We show that without any feature engineering our multi-scale deep learning approach achieves state-of-the-art results in contour detection.

研究の動機と目的

  • 従来のボトムアップパイプラインを逆転させ、高レベルのオブジェクト特徴を低レベルのホッソリ検出の手がかりとして用いること。
  • ディープラーニングアーキテクチャを通じて、マルチスケールの局所的およびグローバルな画像コンテキストを統合することで、ホッソリ検出の精度を向上させること。
  • 分類と人間の合意度回帰を同時に最適化することで、両方の精度と再現率が向上することを示すこと。
  • オブジェクト分類タスクで事前学習されたディープ特徴が、手動の特徴工学を伴わずにホッソリ検出性能を著しく向上させることを示すこと。

提案手法

  • 本手法は、KrizhevskyらのKNetの最初の5つの畳み込み層を、ImageNetでオブジェクト分類のために事前学習済みのものとして再利用し、入力画像から階層的特徴を抽出する。
  • 入力画像の4つの並列なマルチスケールバージョンが、共有された畳み込み特徴抽出器を通じて処理され、局所的およびグローバルなコンテキストを捉える。
  • 抽出された特徴は、2つの独立して学習されるブランチを持つ分岐型の全結合サブネットワークに供給される:一方はエッジ分類(バイナリクロスエントロピー損失)、他方は人間のラベルラー合意度の回帰(MSE損失)。
  • 推論時、両ブランチのスカラー出力を平均化して、各候補点ごとの最終的なホッソリスコアを生成する。
  • 候補ホッソリ点はCannyエッジ検出器を用いて生成され、それらの周囲のパッチが4つのスケールで処理され、空間的コンテキストを保持する。
  • 特徴の補間戦略が提案され、推論コストを60Kから4KのKNet評価に削減するランタイム最適化が実現された。

実験結果

リサーチクエスチョン

  • RQ1事前学習されたディープネットワークからの高レベルオブジェクト特徴は、低レベルホッソリ検出性能を向上させることができるか?
  • RQ2局所的およびグローバルコンテキストを統合するマルチスケールディープネットワークは、シングルスケールアプローチに比べてより優れたホッソリ検出を達成するか?
  • RQ3分岐型ネットワークアーキテクチャで分類と回帰の目的関数を別々に最適化することで、ホッソリ検出における精度と再現率の両方が向上するか?
  • RQ4人間のラベルラー合意度を回帰ターゲットとして用いる場合、標準的なエッジ検出基準と比較して、人間の知覚をどれほどうまく模倣できるか?

主な発見

  • DeepEdgeはBSDS500データセットで平均精度0.81という最先端の性能を達成し、すべての先行および同時期の手法を上回った。
  • 回帰ブランチのみでも平均精度0.80を達成しており、高信頼度のホッソリピクセルを識別する能力が非常に高いことが示された。
  • 分類ブランチのみでもFスコア0.76を達成しており、真のホッソリを検出する能力が高く、再現率が優れていることが示された。
  • 両ブランチの予測を統合すると、Fスコア0.77および平均精度0.81となり、いずれのブランチ単体よりも優れた性能を示した。
  • 定性的な結果から、DeepEdgeは弱いホッソリ(例:シマウマの縞模様)を効果的に抑制しながら、強いオブジェクト境界を保持しており、正解と非常に近い結果を示した。
  • 特徴マップの補間戦略を組み合わせることで、計算コストが著しく効率化され、1枚あたりのKNet評価回数が60Kからわずか4に削減され、CPU上でリアルタイム推論が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。