Skip to main content
QUICK REVIEW

[論文レビュー] A New Convolutional Network-in-Network Structure and Its Applications in Skin Detection, Semantic Segmentation, and Artifact Reduction

Yoonsik Kim, Insung Hwang|arXiv (Cornell University)|Jan 22, 2017
Image Enhancement Techniques参考文献 45被引用数 15
ひとこと要約

本稿では、インセプションモジュールに基づいた変更版ネットワークインネットワークアーキテクチャを提案する。プーリング層を削除して特徴マップの解像度を維持するとともに、受容 field を維持するための大きな7×7畳み込みフィルタを追加している。得られた軽量で完全畳み込み型のネットワークは、パrameterが重いデコンボリューションやアップサンプリング層を必要とせず、皮膚検出、セマンティックセグメンテーション、JPEGアーティファクト低減において最先端または競争力のある性能を達成しており、画像対画像タスクにおける強力な有効性を示している。

ABSTRACT

The inception network has been shown to provide good performance on image classification problems, but there are not much evidences that it is also effective for the image restoration or pixel-wise labeling problems. For image restoration problems, the pooling is generally not used because the decimated features are not helpful for the reconstruction of an image as the output. Moreover, most deep learning architectures for the restoration problems do not use dense prediction that need lots of training parameters. From these observations, for enjoying the performance of inception-like structure on the image based problems we propose a new convolutional network-in-network structure. The proposed network can be considered a modification of inception structure where pool projection and pooling layer are removed for maintaining the entire feature map size, and a larger kernel filter is added instead. Proposed network greatly reduces the number of parameters on account of removed dense prediction and pooling, which is an advantage, but may also reduce the receptive field in each layer. Hence, we add a larger kernel than the original inception structure for not increasing the depth of layers. The proposed structure is applied to typical image-to-image learning problems, i.e., the problems where the size of input and output are same such as skin detection, semantic segmentation, and compression artifacts reduction. Extensive experiments show that the proposed network brings comparable or better results than the state-of-the-art convolutional neural networks for these problems.

研究の動機と目的

  • セグメンテーションや修復などの画像対画像タスクにおいて、プーリングが空間解像度を低下させることに起因する標準的なインセプションネットワークの限界を是正すること。
  • 正確なピクセル単位の予測を可能にするために、特徴マップのサイズを完全に維持し、デコンボリューションやアップサンプリング層の必要性を排除すること。
  • 密集予測およびプーリング層を削除することでモデルパラメータを削減するとともに、大きなカーネルにより受容 field を保持すること。
  • 提案アーキテクチャを、皮膚検出、セマンティックセグメンテーション、圧縮アーティファクト低減という3つの主要な画像対画像学習問題に対して評価すること。

提案手法

  • 提案アーキテクチャは、元のインセプションモジュール内のプーリング層およびプールプロジェクション層を、空間解像度を維持し受容 field を拡大する1つの7×7畳み込み層に置き換える。
  • ネットワークは畳み込み層およびReLU層のみから構成され、完全結合層およびプーリング層が排除されており、エンドツーエンドのピクセル単位の予測をサポートする。
  • 並列に1×1、3×3、7×7畳み込みを用いた変更版インセプションモジュールを採用し、ダウンサンプリングなしにマルチスケール特徴を抽出する。
  • 標準的なバックプロパゲーションを用いて訓練され、損失関数はタスクに応じて適応される:皮膚検出にはバイナリクロスエントロピー、セマンティックセグメンテーションにはソフトマックス、アーティファクト低減にはL2損失。
  • 同じ深さおよびフィルタ数を有する同一モデルを3つのタスクに適用し、損失関数および出力次元のみを変更することで、公平な比較が可能となる。
  • アーキテクチャは、皮膚検出にはECUおよびPratheepan、セマンティックセグメンテーションにはCamVid、アーティファクト低減にはJPEG圧縮画像を用いたベンチマークデータセットで評価された。

実験結果

リサーチクエスチョン

  • RQ1プーリング層を含まないインセプションに類似したアーキテクチャが、セマンティックセグメンテーションや画像修復などの画像対画像タスクで競争力のある性能を達成できるか?
  • RQ2プーリングおよびデコンボリューション層を削除し、大きなカーネルを追加することで、ピクセル単位の予測タスクにおける受容 field および性能が維持または向上するか?
  • RQ3提案されたネットワークは、皮膚検出、セマンティックセグメンテーション、JPEGアーティファクト低減において、最先端手法と比較してどのように差をつけるか?
  • RQ4パrameterが少ない軽量な完全畳み込み型ネットワークが、画像対画像学習において、より深く複雑なアーキテクチャを上回ることができるか?

主な発見

  • CamVidセマンティックセグメンテーションデータセットにおいて、提案ネットワークは85.5%のグローバル正解率、65.1%のクラス平均正解率、51.7%の平均IoUを達成し、FCNおよびSegNetを上回った。
  • ECUデータセットでは、皮膚検出で93.8%のF1スコアを達成し、ベイジアン、DSPF、FPSDベースラインを上回った。
  • Pratheepanデータセットでは、94.1%のF1スコアを達成し、多様な皮膚色分布にわたる強靭性を示した。
  • JPEGアーティファクト低減においては、LIVE1データセットでQ=10のとき29.34 dBのPSNRおよび0.820のSSIM、Q=20のとき31.60 dBのPSNRおよび0.894のSSIMを達成し、SA-DCT、AR-CNN、RAR-CNNを上回った。
  • 主観的評価では、特に高圧縮状況下で、提案手法が鋭いエッジと少ないリングアーティファクトを生成することが確認された。
  • アブレーションスタディにより、プーリングの削除および7×7フィルタの追加が性能を顕著に向上させたことが確認され、空間解像度および受容 field の保持という設計選択の妥当性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。