Skip to main content
QUICK REVIEW

[論文レビュー] Improving Fully Convolution Network for Semantic Segmentation

Bing Shuai, Ting Liu|arXiv (Cornell University)|Nov 28, 2016
Advanced Neural Network Applications参考文献 30被引用数 21
ひとこと要約

本稿では、受容 field を拡大し、マルチスケールの文脈的特徴を統合するために、密度付きスキップ接続を備えたコンテキストネットワークを導入することで、語義的セグメンテーションを向上させる Improved Fully Convolutional Network (IFCN) を提案する。IFCN は、後処理や COCO での事前学習を一切用いず、ADE20K、Pascal Context、Pascal VOC 2012、SUN-RGBD において最先端の性能を達成しており、すべてのベンチマークで FCN よりも 7.5% 以上の mIOU を上回っている。

ABSTRACT

Fully Convolution Networks (FCN) have achieved great success in dense prediction tasks including semantic segmentation. In this paper, we start from discussing FCN by understanding its architecture limitations in building a strong segmentation network. Next, we present our Improved Fully Convolution Network (IFCN). In contrast to FCN, IFCN introduces a context network that progressively expands the receptive fields of feature maps. In addition, dense skip connections are added so that the context network can be effectively optimized. More importantly, these dense skip connections enable IFCN to fuse rich-scale context to make reliable predictions. Empirically, those architecture modifications are proven to be significant to enhance the segmentation performance. Without engaging any contextual post-processing, IFCN significantly advances the state-of-the-arts on ADE20K (ImageNet scene parsing), Pascal Context, Pascal VOC 2012 and SUN-RGBD segmentation datasets.

研究の動機と目的

  • 標準的な完全畳み込みネットワーク(FCN)が高解像度入力の処理や限界的な文脈的認識能力に課題を抱えることに対処する。
  • ImageNet 分類の事前学習と高解像度セグメンテーションタスクとの間のドメインギャップを低減する。
  • より豊富なマルチスケール文脈特徴の集約とより大きな有効受容 field を可能にすることで、語義的セグメンテーションの性能を向上させる。
  • 新たな計算レイヤーを追加せず、補助的な事前学習データを必要としない、プラグインアーキテクチャを開発する。

提案手法

  • 特徴マップの受容 field を段階的に拡大するために、密度付きスキップ接続を備えたスタックされた畳み込みブロックで構成されるコンテキストネットワークを導入する。
  • すべての中間特徴マップからの密度付きスキップ接続を用いることで、誤差逆伝播を促進し、コンテキストネットワークの有効な最適化を可能にする。
  • 事前学習済みの VGG-16 ネットワークの初期層からのスキップ接続を統合し、マルチスケール特徴を融合して局所化精度を向上させる。
  • ネットワークサイズを縮小し、特徴マップのコンパクト性を向上させるために、最終的な全結合層(fc6, fc7)を削除する。
  • コンテキストネットワークを事前学習済み CNN とアップサンプリング層の間に挿入することで、セグメンテーションデータに対するエンドツーエンドの微調整が可能になるように、修正されたアーキテクチャを採用する。
  • 標準的なディープラーニングフレームワークを用いて実装することで、互換性とデプロイの容易さを確保する。

実験結果

リサーチクエスチョン

  • RQ1FCN 特徴マップの受容 field をどのように効果的に拡大すれば、語義的セグメンテーションにおける文脈理解を向上させられるか?
  • RQ2コンテキストネットワークにおける密度付きスキップ接続は、高解像度セグメンテーションタスクにおける最適化と特徴融合を改善できるか?
  • RQ3初期層と深層の特徴からのマルチスケール文脈特徴の集約は、多様なデータセットにおいてどの程度セグメンテーション精度を向上させるか?
  • RQ4補助データセット(例:COCO)を用いた事前学習なしで、修正された FCN アーキテクチャが最先端の性能を達成できるか?
  • RQ5提案された IFCN アーキテクチャは、DeepLab や DilatedNet などの既存の最先端モデルと比較して、推論効率と精度の両面で優れているか?

主な発見

  • IFCN-8s は Pascal VOC 2012 で 79.3% の mIOU を達成し、FCN-8s(37.8%)を著しく上回り、DeepLab-v2 や DilatedNet よりも優れた結果を示している。
  • ADE20K では IFCN-8s が 75.3% の mIOU を達成し、FCN-8s や CRF-RNN や UoA-Context といった他の最先端手法を上回っている。
  • Pascal Context では IFCN-8s が 75.3% の mIOU を達成し、FCN-8s や LRR や DPN といった最先端モデルと比較して一貫した向上を示している。
  • SUN-RGBD では IFCN-8s が 45.0% の mIOU を達成し、屋内・屋外の両方のシーンにわたる強力な一般化性能を示している。
  • ResNet-101 バックボーンを用いた IFCN-8s は Pascal Context で 49.9% の mIOU を達成し、COCO での事前学習を一切使用せずに、さらなる最先端性能を達成している。
  • IFCN-8s(VGG-16)の推論時間は 1 イメージあたり 47.9ms であり、その性能向上を考慮すると妥当な水準であり、現代のディープラーニングフレームワークとも互換性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。