[論文レビュー] Y-net: Multi-scale feature aggregation network with wavelet structure similarity loss function for single image dehazing
本稿では、1×1畳み込みによるマルチスケール特徴の融合と、ウェーブレット構造類似度(W-SSIM)損失関数の導入により、1枚の画像からのホコリ除去性能を向上させるY-Netという、マルチスケール特徴集約U-Netの変種を提案する。W-SSIM損失は、複数スケールのウェーブレットサブバンドにわたるSSIMを適用することで、明瞭性を向上させ、詳細の保持を促進し、アーチファクトを低減する。
Single image dehazing is the ill-posed two-dimensional signal reconstruction problem. Recently, deep convolutional neural networks (CNN) have been successfully used in many computer vision problems. In this paper, we propose a Y-net that is named for its structure. This network reconstructs clear images by aggregating multi-scale features maps. Additionally, we propose a Wavelet Structure SIMilarity (W-SSIM) loss function in the training step. In the proposed loss function, discrete wavelet transforms are applied repeatedly to divide the image into differently sized patches with different frequencies and scales. The proposed loss function is the accumulation of SSIM loss of various patches with respective ratios. Extensive experimental results demonstrate that the proposed Y-net with the W-SSIM loss function restores high-quality clear images and outperforms state-of-the-art algorithms. Code and models are available at https://github.com/dectrfov/Y-net.
研究の動機と目的
- 大気光や透過率に関する明示的な事前知識を用いずに、エンドツーエンドで学習することで、1枚の画像からのホコリ除去の不適切な性質に対処する。
- CNNエンコーダ-デコーダの異なる層からのマルチスケール特徴を統合することで、画像修復品質を向上させる。
- 離散ウェーブレット変換とSSIMに基づく新しい損失関数を設計することで、知覚的品質を向上させ、アーチファクトを低減する。
- 従来の事前知識ベースおよびディープラーニングベースのホコリ除去手法と比較して、合成データセット上で優れた性能を示す。
提案手法
- エンコーダとデコーダパスからのマルチスケール特徴マップを1×1畳み込みを用いて統合し、最終出力を形成するY字型のネットワークアーキテクチャを提案する。
- ダウンサンプリングにはストライド畳み込みとマックスプーリング、アップサンプリングには逆畳み込みを用いるが、U-Netと同様の構造を採用し、最終的なスキップ接続をマルチスケール統合に置き換える。
- 画像を異なるスケールと周波数のサブバンドに分解するため、再帰的な離散ウェーブレット変換(DWT)を適用するウェーブレットSSIM(W-SSIM)損失関数を導入する。
- 高周波数サブバンド(LH、HL、HH)と低周波数サブバンド(LL)に対してSSIMを計算し、高周波数ディテールの優先とハローアーチファクトの抑制を可能にする可変重みを設定する。
- 3回の反復を経た再帰的DWT処理を実施し、ハールウェーブレットを用い、マルチスケールの一貫性を確保するため、適応的な比率(x = r²、y = r(1−r)、z = (1−r)²)でSSIM損失を累積する。
- RESIDEデータセット上で、バッチサイズ32、入力解像度480×480、初期学習率0.0001でAdam最適化手法を用いてネットワークを訓練する。

実験結果
リサーチクエスチョン
- RQ1U-Netに類似したアーキテクチャにおけるマルチスケール特徴集約は、標準的なスキップ接続と比較して、はたしてホコリ除去性能を顕著に向上させるか?
- RQ2ウェーブレットベースのSSIM損失関数は、標準的なL2損失やSSIM損失と比較して、画像のホコリ除去においてより優れた知覚的品質と低減されたアーチファクトを実現するか?
- RQ3提案されたW-SSIM損失関数は、明示的な深度または透過率の事前知識を必要とせずに、複数の周波数帯域における特徴学習を向上させることができるか?
- RQ4W-SSIM損失とL2損失の組み合わせは、個別の損失関数と比較して、ホコリ除去画像のPSNRおよびSSIMにおいて優れた性能を示すか?
主な発見
- 提案されたY-Netは、合成データセットRESIDE上でPSNR 26.61、SSIM 0.947を達成し、AOD-Net、MBE、W-U-Netを含むすべての比較手法を上回った。
- W-SSIM損失単体でも、標準L2損失と比較してPSNRが0.30向上、SSIMが0.012向上し、L2損失と組み合わせることでPSNRは26.61、SSIMは0.947にさらに向上した。
- FADEの知覚的評価指標では、それぞれRiverで1.77、Peopleで2.37、Willowで0.592のスコアを記録し、知覚的品質においてすべてのベースラインを上回った。
- 視覚的結果から、唯一提案手法が河川表面からのホコリをノイズやアーチファクトを引き起こさずに効果的に除去しているのに対し、MBEなどの他の手法は斑点ノイズを発生させた。
- W-SSIM損失関数は、高周波数ディテールの保持とハローエフェクトの抑制に成功しており、全テスト画像においてSSIMと知覚的スコアの向上が確認された。
- アブレーションスタディの結果、L2損失や標準SSIM損失と比較してW-SSIM損失がより効果的であることが確認され、ネットワークが知覚的に優れた再構成を目指すのを支援できることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。