Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Smoothing of Dilated Convolutions for Image Segmentation

Thomas Ziegler, Manuel Fritsche|arXiv (Cornell University)|Mar 19, 2019
Advanced Neural Network Applications参考文献 17被引用数 6
ひとこと要約

本論文は、畳み込み層の前処理として単純な補間フィルタ(平均またはガウス)を入力特徴量に適用することで、拡張畳み込みにおける軽量でパラメータフリーの平滑化手法を提案する。この手法は、従来の手法と比較して顕著に低い学習コストでセマンティック画像セグメンテーションの精度を向上させ、DeepLabv2と比較してPASCAL VOC 2012およびCityscapesでわずか2.89–4.34%の追加学習時間で最先端の性能を達成している。

ABSTRACT

Dilated Convolutions have been shown to be highly useful for the task of image segmentation. By introducing gaps into convolutional filters, they enable the use of larger receptive fields without increasing the original kernel size. Even though this allows for the inexpensive capturing of features at different scales, the structure of the dilated convolutional filter leads to a loss of information. We hypothesise that inexpensive modifications to Dilated Convolutional Neural Networks, such as additional averaging layers, could overcome this limitation. In this project we test this hypothesis by evaluating the effect of these modifications for a state-of-the art image segmentation system and compare them to existing approaches with the same objective. Our experiments show that our proposed methods improve the performance of dilated convolutions for image segmentation. Crucially, our modifications achieve these results at a much lower computational cost than previous smoothing approaches.

研究の動機と目的

  • モデルの複雑さを増さずに、拡張畳み込みにおける情報損失やグリッドアーチファクトを軽減すること。
  • トレーニング可能なパラメータを追加する従来の平滑化手法の計算コストを低減すること。
  • 単純でトレーニング不可のフィルタが、複雑でパラメータが多いベースラインと同等またはそれ以上の性能を達成できるかどうかを評価すること。
  • 低い学習オーバーヘッドでより良いセグメンテーション品質を実現できることを示すこと。

提案手法

  • 各入力チャネルに対して、拡張畳み込みの前に事前フィルタ(平均またはガウス)を適用し、局所的な空間的情報を強化する。
  • 追加のトレーニング可能なパラメータを導入しないため、固定で学習不可のフィルタを使用する。
  • フィルタリング処理をネットワークアーキテクチャに直接統合し、各拡張畳み込み層の直前に配置する。
  • 追加のトレーニング可能なレイヤーを用いるG InteractおよびSS Convといった最先端のベースラインと性能を比較する。
  • PASCAL VOC 2012およびCityscapesで、各手法に共通のハイパーパrameterを用いてモデルを学習する。
  • mIoUと学習時間を測定することで、精度と効率の両面から性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1単純でトレーニング不可のフィルタは、画像セグメンテーションにおける拡張畳み込みのロバスト性を向上させることができるか?
  • RQ2事前フィルタの適用は、拡張畳み込みにおけるグリッドアーチファクトと情報損失を低減するか?
  • RQ3この手法は、顕著に低い学習コストで、従来の平滑化手法と同等またはそれ以上のセグメンテーション性能を達成できるか?
  • RQ4提案手法の性能向上は、異なるデータセットおよびネットワーク構成においても一貫して有効であるか?

主な発見

  • 平均フィルタは、CityscapesデータセットにおいてDeepLabv2のベースラインを上回るmIoUの向上を達成し、SS Convベースラインをも上回った。
  • ガウスフィルタは、CityscapesにおいてDeepLabv2よりわずかに高いmIoUを達成し、学習時間はわずか2.89%増加にとどまった。
  • 平均フィルタは、DeepLabv2と比較してわずか4.34%の追加学習時間で、22.04%の追加学習時間を要するより複雑なSS Conv手法を上回る性能を達成した。
  • 提案手法は、PASCAL VOC 2012およびCityscapesの両方で最小限の計算オーバーヘッドで最先端の性能を達成した。
  • 追加のトレーニング可能なパラメータを一切使用しないにもかかわらず、SS Convベースラインを上回る性能を示した。これは、性能向上に複雑さが必ずしも必要ではないことを示している。
  • 結果から、単純で固定のフィルタが、拡張畳み込みにおける情報損失とグリッドアーチファクトを効果的に軽減できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。