Skip to main content
QUICK REVIEW

[論文レビュー] WaveSNet: Wavelet Integrated Deep Networks for Image Segmentation

Qiufu Li, Linlin Shen|arXiv (Cornell University)|May 29, 2020
Advanced Neural Network Applications参考文献 16被引用数 8
ひとこと要約

WaveSNetは、畳み込みニューラルネットワークにおけるダウンサンプリングおよびアップサンプリングの過程で画像の詳細を保持・回復するために、微分可能な離散ウェーブレット変換(DWT)および逆DWT(IDWT)レイヤーを導入する。U-Net、SegNet、DeepLabv3+のアーキテクチャにおいて、標準的なプーリングおよびアンプーリングの代わりにDWT/IDWTを使用することで、CamVid、Pascal VOC、Cityscapesのベンチマークで最先端の性能を達成し、特に細かい物体や類似した物体のセグメンテーション性能が向上する。

ABSTRACT

In deep networks, the lost data details significantly degrade the performances of image segmentation. In this paper, we propose to apply Discrete Wavelet Transform (DWT) to extract the data details during feature map down-sampling, and adopt Inverse DWT (IDWT) with the extracted details during the up-sampling to recover the details. We firstly transform DWT/IDWT as general network layers, which are applicable to 1D/2D/3D data and various wavelets like Haar, Cohen, and Daubechies, etc. Then, we design wavelet integrated deep networks for image segmentation (WaveSNets) based on various architectures, including U-Net, SegNet, and DeepLabv3+. Due to the effectiveness of the DWT/IDWT in processing data details, experimental results on CamVid, Pascal VOC, and Cityscapes show that our WaveSNets achieve better segmentation performances than their vanilla versions.

研究の動機と目的

  • 深層ネットワークにおけるダウンサンプリングの過程で生じるデータ詳細の損失が引き起こす画像セグメンテーション性能の低下を是正すること。
  • 1D、2D、3Dデータおよびさまざまなウェーブレット(例:ハール、ダウベシエス、コーエン)に適用可能な汎用的で微分可能なDWT/IDWTレイヤーの開発。
  • 推論時にデータの詳細を明示的に処理するエンドツーエンドのウェーブレット統合ネットワーク(WaveSNets)の設計。
  • 詳細に敏感な特徴学習により、細分化された物体および構造的に類似した物体のセグメンテーション精度の向上。

提案手法

  • 標準的な深層学習フレームワークと互換性を持つように、DWTおよびIDWTを学習可能で微分可能なレイヤーに再定式化。
  • ダウンサンプリングパスにおけるマックスプーリングの代替としてDWTを統合し、高周波数成分の詳細を保持。
  • アップサンプリング処理の代替としてIDWTを統合し、元の空間解像度を詳細を保持した状態で再構築。
  • U-Net、SegNet、DeepLabv3+の複数のアーキテクチャにDWT/IDWTレイヤーを適用。
  • ハール、コーエン、ダウベシエスなどの異なるウェーブレットを用いて、信号表現の多様性に対するロバストネスと性能を評価。
  • 標準的なトレーニングプロトコルに従い、標準的な最適化手法を用いてエンドツーエンドで学習。

実験結果

リサーチクエスチョン

  • RQ1DWTおよびIDWTは、深層ネットワークにおける学習可能で微分可能なレイヤーとして、ダウンサンプリングおよびアップサンプリングの過程で画像の詳細を効果的に保持できるか?
  • RQ2標準的なプーリングおよびアンプーリングをDWT/IDWTに置き換えることで、標準ベンチマークにおけるセマンティックセグメンテーション性能が向上するか?
  • RQ3ウェーブレットの選択(例:ハール、ダウベシエス、コーエン)がセグメンテーション精度および詳細回復に与える影響は何か?
  • RQ4WaveSNetは、アンサンブルアーキテクチャに比べて、細分化された物体および類似した物体においてより優れた性能を発揮できるか?

主な発見

  • WaveSNetは'ch5.5'ウェーブレットを用いることで、Pascal VOCの検証セットで79.90%のmIoUを達成し、ベースラインのDeepLabv3+を1.22%上回る。
  • Cityscapesでは70.63%のmIoUを達成し、アンサンブルのDeepLabv3+を上回り、優れた一般化性能を示している。
  • 『チェア』『テーブル』『プラント』などの細かい物体に関して、WaveSNetはベースラインモデルに比べてmIoUが最大5.5%向上している。
  • 『コウノトリ』『馬』『ヤギ』などの類似した物体では、構造的詳細をよりよく保持することで誤分類が減少している。
  • 可視化比較では、WDeepLabv3+が細かい領域(例:角、脚)を正しくセグメンテーションしており、類似した動物同士を誤って分類するのを回避している。
  • パrameterの増加はわずか0.88Mであり、複数のデータセットで一貫した性能向上を達成している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。