Skip to main content
QUICK REVIEW

[論文レビュー] Superpixel Convolutional Networks using Bilateral Inceptions

Raghudeep Gadde, Varun Jampani|arXiv (Cornell University)|Nov 20, 2015
Advanced Neural Network Applications参考文献 29被引用数 4
ひとこと要約

本論文は、畳み込みニューラルネットワーク(CNN)におけるセマンティックセグメンテーションのため、複数スケールでスーパーピクセル間を特徴を伝搬する学習可能でエッジに注意を向けるフィルタであるバイラテラルインセプション(BI)モジュールを提案する。1×1畳み込み層の間にBIモジュールを挿入することで、ベースラインCNNやDenseCRFと比較して分類精度を向上させつつ、フル解像度の出力を維持し、推論速度も高速化する。

ABSTRACT

In this paper we propose a CNN architecture for semantic image segmentation. We introduce a new 'bilateral inception' module that can be inserted in existing CNN architectures and performs bilateral filtering, at multiple feature-scales, between superpixels in an image. The feature spaces for bilateral filtering and other parameters of the module are learned end-to-end using standard backpropagation techniques. The bilateral inception module addresses two issues that arise with general CNN segmentation architectures. First, this module propagates information between (super) pixels while respecting image edges, thus using the structured information of the problem for improved results. Second, the layer recovers a full resolution segmentation result from the lower resolution solution of a CNN. In the experiments, we modify several existing CNN architectures by inserting our inception module between the last CNN (1x1 convolution) layers. Empirical results on three different datasets show reliable improvements not only in comparison to the baseline networks, but also in comparison to several dense-pixel prediction techniques such as CRFs, while being competitive in time.

研究の動機と目的

  • セマンティックセグメンテーションにおける構造的出力関係を捉えることの難しい標準CNNの限界を解決すること。
  • アップサンプリングやCRFの微調整といった後処理を必要としないように、ネットワークアーキテクチャに直接エッジに注意を向ける情報伝搬を統合すること。
  • 空間的・光度的整合性を保ちながら、特徴伝搬を向上させるために、画像に適応する構造的レイアウトとしてスーパーピクセルを活用すること。
  • CNNフレームワーク内でのバイラテラルフィルタのパラメータと特徴空間をエンドツーエンドで学習可能にすること。
  • 追加のスケーリングやCRFの後処理ステップなしに、フル解像度のセグメンテーションマスクを直接出力すること。

提案手法

  • 複数の特徴スケールでスーパーピクセル間をバイラテラルフィルタリングする新しい「バイラテラルインセプション」(BI)モジュールを導入する。
  • 最終層の標準的なグリッドベースの畳み込みの代わりに、特徴伝搬のための空間的レイアウトとしてスーパーピクセルを使用する。
  • バックプロパゲーションによる誤差逆伝播を用いて、バイラテラルフィルタの特徴空間とカーネルパラメータをエンドツーエンドで学習する。
  • DeepLab や AlexNet などの既存のCNNアーキテクチャの最終1×1畳み込み(FC)層の間にBIモジュールを挿入する。
  • 空間的近接性と色の類似性の両方を考慮したガウスカーネルを用いて、エッジに注意を向ける情報伝搬を実行する。
  • 補間やCRFの微調整なしに、低解像度のCNN特徴から直接フル解像度のセグメンテーションマスクを回復する。

実験結果

リサーチクエスチョン

  • RQ1スーパーピクセル間での学習可能なバイラテラルフィルタリングが、標準CNNやCRFの後処理と比較してセマンティックセグメンテーションの性能を向上させるか?
  • RQ2画像に適応する構造的レイアウトとしてのスーパーピクセルを用いることで、オブジェクト境界を保ちながら特徴伝搬が向上するか?
  • RQ3CNNフレームワーク内でバイラテラルフィルタのパラメータをエンドツーエンドで学習することで、固定または手動で設計されたCRF推論戦略を上回る性能が得られるか?
  • RQ4BIモジュールによって、セマンティックセグメンテーションにおける別個のアップサンプリングやCRF微調整ステップの必要性はどの程度軽減されるか?
  • RQ5ベンチマークデータセット上で、BIモジュールはDenseCRF や他の密予測手法と比較して、精度と速度の両面で優れているか?

主な発見

  • DeepLabモデルにBIモジュールを追加した場合、Cityscapesの検証セットで66.9%のIoUを達成し、ベースラインモデル(65.7%)およびDeepLab + DenseCRFベースライン(66.6%)を上回った。
  • PASCAL VOC 2012データセットでは、半分解像度の入力でベースラインDeepLabモデルのIoUを62.2%から63.1%へ、フル解像度入力では65.7%から66.9%へ向上させた。
  • CityscapesやPASCAL VOCを含む3つのデータセットすべてで、DenseCRFを上回る性能を達成したが、著しく高速であった(例:Cityscapesでは6.1秒 vs. 6.9秒の実行時間)。
  • エッジに注意を向ける伝搬により、バイリニア補間や一部のCRF手法で見られるぼやけを避けることができる、より鋭いセグメンテーション境界を生成した。
  • 実行時間の大部分(Cityscapesでは5.2秒)はスーパーピクセルの計算に起因しているが、BI推論自体はスーパーピクセル数に応じて効率的かつスケーラブルである。
  • BIモジュールはモジュラーであり、アーキテクチャの大幅な見直しを伴わずに既存のCNNアーキテクチャに挿入可能であり、広範な適用可能性と統合の容易さを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。