Skip to main content
QUICK REVIEW

[論文レビュー] A Regularized Convolutional Neural Network for Semantic Image Segmentation

Fan Jia, Jun Liu|arXiv (Cornell University)|Jun 28, 2019
Advanced Neural Network Applications参考文献 31被引用数 5
ひとこと要約

本稿では、畳み込みニューラルネットワーク(CNN)における意味的画像セグメンテーションのため、全変動(TV)空間正則化を統合した正則化softmax層を提案する。softmax活性化関数を変更してTV正則化を組み込むことで、エッジの保持とノイズへのロバスト性が向上し、WBC、CamVid、SUN-RGBDデータセットにおいて、特にノイズがある条件下でも、Unet や Segnet などの標準CNNを顕著に上回る性能を発揮する。

ABSTRACT

Convolutional neural networks (CNNs) show outstanding performance in many image processing problems, such as image recognition, object detection and image segmentation. Semantic segmentation is a very challenging task that requires recognizing, understanding what's in the image in pixel level. Though the state of the art has been greatly improved by CNNs, there is no explicit connections between prediction of neighbouring pixels. That is, spatial regularity of the segmented objects is still a problem for CNNs. In this paper, we propose a method to add spatial regularization to the segmented objects. In our method, the spatial regularization such as total variation (TV) can be easily integrated into CNN network. It can help CNN find a better local optimum and make the segmentation results more robust to noise. We apply our proposed method to Unet and Segnet, which are well established CNNs for image segmentation, and test them on WBC, CamVid and SUN-RGBD datasets, respectively. The results show that the regularized networks not only could provide better segmentation results with regularization effect than the original ones but also have certain robustness to noise.

研究の動機と目的

  • 意味的画像セグメンテーションにおける標準CNNに明示的な空間正則化が欠如していることによる、破片的または不規則な予測の問題に対処する。
  • ネットワークアーキテクチャに直接空間正則化を埋め込むことで、セグメンテーションモデルのノイズに対するロバスト性を向上させる。
  • 隣接ピクセル間の滑らかさを強制することで、予測における構造的一致性(例:物体境界)を維持する。
  • 主なアーキテクチャ変更なしに、従来の変動正則化(例:TV)をディープラーニングフレームワークにシームレスに統合する。
  • バイオメディカル(WBC)、都市風景(CamVid)、屋内環境(SUN-RGBD)を含む多様なデータセットにおいて、本手法の有効性を実証する。

提案手法

  • バックプロパゲーション中に損失関数に全変動(TV)正則化を組み込む正則化softmax層を提案する。
  • 勾配計算を変更し、TV正則化項を含めることで、空間的に滑らかな予測を学習しつつ、エンドツーエンド微分可能を維持する。
  • エンコーダ・デコーダ構造やその他の層を変更せずに、既存のCNNアーキテクチャ(Unet および Segnet)に正則化softmax層を適用する。
  • TV正則化付きのsoftmaxの勾配を効率的に計算するため、プロキシマル勾配法を用いる。
  • 固定学習率とバッチサイズを用いて、転移学習のための事前学習済みImageNet重みを保持したまま、修正されたネットワーク(RUnet, RSegnet)を標準最適化で訓練する。
  • クリーンおよびノイズありテストデータにおけるmIoU、正解度、再構成誤差(RE)を用いて性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1CNNのsoftmax活性化関数に全変動(TV)正則化を統合することで、意味的セグメンテーション予測の空間的整合性が向上するか?
  • RQ2提案手法の正則化は、特にノイズや低品質な入力データにおいて、画像セグメンテーションのロバスト性を向上させるか?
  • RQ3RUnetおよびRSegnetの性能は、複雑さやノイズレベルが異なる多様なデータセットにおいて、元のアーキテクチャと比較してどうなるか?
  • RQ4本手法は、大幅なアーキテクチャ変更なしに、既存のCNNアーキテクチャに適用可能で、再訓練から始めずに利用可能か?
  • RQ5正則化は、細かい構造を有する複雑なシーンにおいて、物体境界の過剰な平滑化を防ぐか?

主な発見

  • RUnetはクリーンなSUN-RGBDデータセットで27.40 mIoUを達成し、標準Unet(26.50 mIoU)を上回り、0.9%の向上を示した。
  • σ=0.09のガウスノイズを含むSUN-RGBDノイズありデータでは、RSegnet2は21.90のmIoUを維持したのに対し、Segnet2は21.12にとどまり、より高いロバスト性を示した。
  • 塩こしょうノイズ(1%のピクセルが損傷)の下では、RSegnet2は24.42のmIoUを達成し、Segnet2の23.36を上回った。
  • RSegnet2の再構成誤差(RE)は、クリーンデータで2.31、高ノイズデータで3.39であり、それぞれSegnet2の4.84および5.40よりも顕著に低かった。
  • RSegnetはCamVidで遠くの杭のような細かい構造を保持したのに対し、Segnetに対して後処理でTVを適用した場合、過剰な平滑化が生じた。これは、ネットワーク内に正則化を組み込む利点を示している。
  • WBCデータセットでは、RUnetはノイズ下でも高いセグメンテーション品質を維持したが、標準Unetの性能は急激に低下した。これにより、本手法のロバスト性が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。