Skip to main content
QUICK REVIEW

[論文レビュー] SDWNet: A Straight Dilated Network with Wavelet Transformation for Image Deblurring

Wenbin Zou, Mingchao Jiang|arXiv (Cornell University)|Oct 12, 2021
Advanced Image Processing Techniques参考文献 40被引用数 8
ひとこと要約

SDWNetは、従来のエンコーダ・デコーダ構造の代わりに拡張畳み込みとウェーブレットに基づく周波数ドメイン強化を用いる、軽量でエンドツーエンドのCNNを提案する。アップサンプリング/ダウンサンプリングを伴わずに、マルチレートの拡張畳み込みにより大域的な受容 field を捉えることで、高周波数成分の回復にウェーブレット再構成モジュールを用いる。これにより、GoProデータセットでSOTAのPSNR(31.36)とSSIM(0.967)を達成し、パrameter数は7.2M、FLOPsは181.31 GFLOPsにとどめる。

ABSTRACT

Image deblurring is a classical computer vision problem that aims to recover a sharp image from a blurred image. To solve this problem, existing methods apply the Encode-Decode architecture to design the complex networks to make a good performance. However, most of these methods use repeated up-sampling and down-sampling structures to expand the receptive field, which results in texture information loss during the sampling process and some of them design the multiple stages that lead to difficulties with convergence. Therefore, our model uses dilated convolution to enable the obtainment of the large receptive field with high spatial resolution. Through making full use of the different receptive fields, our method can achieve better performance. On this basis, we reduce the number of up-sampling and down-sampling and design a simple network structure. Besides, we propose a novel module using the wavelet transform, which effectively helps the network to recover clear high-frequency texture details. Qualitative and quantitative evaluations of real and synthetic datasets show that our deblurring method is comparable to existing algorithms in terms of performance with much lower training requirements. The source code and pre-trained models are available at https://github.com/FlyEgle/SDWNet.

研究の動機と目的

  • 繰り返しのアップサンプリングおよびダウンサンプリングに依存する従来のぼけ除去手法の限界、特にテクスチャの損失と収束の困難さを解消する。
  • 敵対的訓練を避けることで、GANベースのぼけ除去手法の不安定さと高コストを克服する。
  • 粗いから細かい構造やマルチステージアーキテクチャを単純なエンドツーエンド設計に置き換えることで、モデルの複雑さと学習の難易度を低減する。
  • 空間ドメインでの周波数ドメイン特徴強化のためのウェーブレット変換を統合することで、高周波数成分の回復を向上させる。
  • 最小限のパrameter数とFLOPsで高い性能を維持する、軽量で効率的なネットワークを開発する。

提案手法

  • ダウンサンプリングやアップサンプリングを伴わない受容 field の拡大を実現する、複数の拡張率を用いた拡張畳み込みモジュールを提案する。
  • 増加する拡張率を有する拡張畳み込みを用いて、異なる空間スケールにおける非局所的な類似特徴を捉える。
  • 離散ウェーブレット変換(DWT)および逆離散ウェーブレット変換(IDWT)を用いて周波数ドメインでぼけ除去を実行するウェーブレット再構成モジュールを導入する。
  • 空間的特徴と周波数ドメイン特徴を統合し、ウェーブレット変換された特徴から再構成することで、高周波数成分を強化する。
  • 再構成精度と知覚的品質のバランスをとるために、可学習なハイパーパrameter λ を用いた、Charbonnier損失とSSIM損失のハイブリッド損失関数を用いる。
  • スキップ接続やマルチステージの最適化を含まない、単一パスのシンプルなアーキテクチャを設計することで、学習の複雑さとパrameter数を低減する。

実験結果

リサーチクエスチョン

  • RQ1エンコーダ・デコーダ構造や粗いから細かい構造を用いない、軽量でエンドツーエンドのCNNアーキテクチャが、競争力あるぼけ除去性能を達成できるか?
  • RQ2アップサンプリングおよびダウンサンプリングの繰り返しを、拡張畳み込みに置き換えることで、テクスチャの損失が軽減され、特徴表現が向上するか?
  • RQ3ウェーブレット変換に基づく周波数ドメイン処理が、復元画像の高周波数成分の強化に有効に機能するか?
  • RQ4拡張畳み込みとウェーブレット再構成の統合は、PSNR、SSIM、モデル効率の観点で、従来のSOTA手法と比較して優れているか?
  • RQ5最良のぼけ除去性能を得るための、ネットワークの深さ、幅、活性化関数、損失重みの最適な設定は何か?

主な発見

  • SDWNetは、GoProテストセットでPSNR 31.36、SSIM 0.967を達成し、DeblurGAN-v2(PSNR: 29.55、SSIM: 0.934)を上回り、他のSOTA手法と同等または上回る性能を示すが、パrameter数は著しく少ない。
  • モデルはたった7.2Mのパrameterと181.31 GFLOPsで、DeblurGAN-v2(60.9Mパrameter、411.34 GFLOPs)や他の複雑なアーキテクチャよりも顕著に効率的である。
  • アブレーションスタディの結果、ELU活性化関数とバイリニア補間が、ReLUとデコンボリューションに比べて性能を向上させ、すべてのモジュールを組み込んだ際のPSNRが27.36から28.36に上昇した。
  • 最適な損失ハイパーパrameter λ は1であると判明し、Charbonnier損失とSSIM損失のバランスを最適化することでPSNRとSSIMを最大化できる。
  • ウェーブレット再構成モジュール(WRM)は高周波数成分の回復に顕著な貢献を示しており、ベースラインにWRMを追加することでPSNRが1.0 dB向上した。
  • 深さd=16、幅w=32の設定でモデルは最高の性能を発揮し、深さよりも幅の変更が性能に与える影響がより大きいことが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。