[論文レビュー] DW-GAN: A Discrete Wavelet Transform GAN for NonHomogeneous Dehazing
DW-GAN は、非一様な画像の霞ましを解消するための二本の分岐を持つ GAN を提案する。この手法は、高周波成分の保持に 2D 離散ウェーブレット変換 (DWT) を統合し、ImageNet で事前学習された Res2Net を用いた知識蒸留を実装することで、限られた学習データでも顕著な性能向上を達成する。本手法は、合成データおよび実世界データセットにおいて最先端の結果を達成しており、NTIRE2021 霞ましチャレンジにおいて PSNR 21.08 dB、SSIM 0.8393 の最高成績を記録した。
Hazy images are often subject to color distortion, blurring, and other visible quality degradation. Some existing CNN-based methods have great performance on removing homogeneous haze, but they are not robust in non-homogeneous case. The reasons are mainly in two folds. Firstly, due to the complicated haze distribution, texture details are easy to be lost during the dehazing process. Secondly, since the training pairs are hard to be collected, training on limited data can easily lead to over-fitting problem. To tackle these two issues, we introduce a novel dehazing network using 2D discrete wavelet transform, namely DW-GAN. Specifically, we propose a two-branch network to deal with the aforementioned problems. By utilizing wavelet transform in DWT branch, our proposed method can retain more high-frequency knowledge in feature maps. In order to prevent over-fitting, ImageNet pre-trained Res2Net is adopted in the knowledge adaptation branch. Owing to the robust feature representations of ImageNet pre-training, the generalization ability of our network is improved dramatically. Finally, a patch-based discriminator is used to reduce artifacts of the restored images. Extensive experimental results demonstrate that the proposed method outperforms the state-of-the-arts quantitatively and qualitatively.
研究の動機と目的
- 非一様な霞ましの課題に対処すること。これは、霞の分布が複雑で、テクスチャの細部が容易に消失するためである。
- ImageNet からの事前学習済み特徴を活用することで、データが少ない状況下での一般化性能を向上させ、過学習を低減すること。
- ネットワークアーキテクチャに離散ウェーブレット変換を組み込むことで、高周波成分(エッジ、テクスチャなど)を保持すること。
- パッチベースの adversarial ディスクライマーを用いて、写真のようにリアルでアーティファクトのない復元画像を生成すること。
- 限られた学習ペアで動作する多様な実世界および合成された霞まし画像データセットにおいて、頑健な性能を達成すること。
提案手法
- 二本の分岐を持つ生成器アーキテクチャを提案する。一方の分岐では、周波数ドメインの情報を保持し、パラメータ数を削減する目的で DWT を用いたダウンサンプリングを採用する。
- DWT 分岐では、標準的な畳み込み層の代わりに、特徴マップ内の高周波成分を保持するための学習可能なウェーブレットダウンサンプリングモジュールを導入する。
- 知識適応分岐では、ImageNet で事前学習済みの Res2Net を特徴エンコーダとして用い、モデルに事前知識を注入することで、小規模データセットでの一般化性能を向上させる。
- チャネル方向および空間方向の注目メカニズムを統合し、ネットワークが重要な特徴や霞まし領域に焦点を当てるのを支援する。
- 局所的なリアリズムを強化し、復元出力のアーティファクトを低減するために、パッチベースのディスクライマーを採用する。
- データ混合時の学習安定性を向上させるために、NH-HAZE および NH-HAZE2 データセットの明るさ分布を一致させる目的でガンマ補正を適用する。
実験結果
リサーチクエスチョン
- RQ1GAN を用いた霞ましネットワークに離散ウェーブレット変換を統合することで、非一様な霞の状況下でも高周波成分の画像細部の保持が向上するか?
- RQ2ImageNet で事前学習済みの Res2Net を用いた知識蒸留は、学習データが限られた状況下でモデルの一般化性能をどの程度向上させるか?
- RQ3提案された二本の分岐アーキテクチャは、実世界および合成された非一様な霞ましベンチマークにおいて、定量的指標および視覚的品質の両面で既存の最先端手法を上回るか?
- RQ4明るさ分布が異なるデータセットを組み合わせる際、トレーニングデータに対するガンマ補正(γ=0.65)がどの程度モデル性能を向上させるか?
- RQ5提案手法は、DENSE-HAZE や NH-HAZE2 といった挑戦的な実世界データセットにおいて、最小限のアーティファクトで頑健な霞まし性能を達成できるか?
主な発見
- DW-GAN は NTIRE2021 霞ましチャレンジにおいて、PSNR 21.08 dB、SSIM 0.8393 を達成し、上位に位置する手法の一つとなった。
- NH-HAZE および NH-HAZE2 データセットにおいて、FFA や GCANet、TDN といった最先端手法を上回る定量的指標および視覚的品質を達成した。
- DENSE-HAZE データセットでは、濃い霞を効果的に除去し、色のずれを最小限に抑え、細部を良好に保持した。FFA や TDN よりも優れた性能を示した。
- NH-HAZE データにガンマ補正(γ=0.65)を適用することで、NH-HAZE2 との明るさの一致が向上し、分布の乖離が低減され、学習性能が向上した。
- DW-GAN の推論時間は GCANet や FFA、TDN よりも速く、優れた性能を維持しているため、効率性と精度のトレードオフに有利な特性を示した。
- アブレーションスタディの結果、DWT 分岐および知識適応分岐の両方が性能向上に大きく寄与しており、注目メカニズムの導入により細部回復性能がさらに向上した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。