Skip to main content
QUICK REVIEW

[論文レビュー] DPFNet: A Dual-branch Dilated Network with Phase-aware Fourier Convolution for Low-light Image Enhancement

Yunliang Zhuang, Zhuoran Zheng|arXiv (Cornell University)|Sep 16, 2022
Image Enhancement Techniques被引用数 13
ひとこと要約

DPFNetは、位相に敏感なフーリエ畳み込みモジュールとマルチ受容 field を持つ拡張畳み込みを用いて、空間領域と周波数領域の特徴を統合的に活用する二重ブランチ畳み込みネットワークを提案する。この手法は、公開ベンチマークで最先端の性能を達成し、LOLデータセットにおいて前人最高の結果を上回ってPSNRを1.23 dB、SSIMを0.012向上させ、新規のフーリエ損失関数と適応的統合モジュールにより、より明確なテクスチャと自然な視覚的品質を実現した。

ABSTRACT

Low-light image enhancement is a classical computer vision problem aiming to recover normal-exposure images from low-light images. However, convolutional neural networks commonly used in this field are good at sampling low-frequency local structural features in the spatial domain, which leads to unclear texture details of the reconstructed images. To alleviate this problem, we propose a novel module using the Fourier coefficients, which can recover high-quality texture details under the constraint of semantics in the frequency phase and supplement the spatial domain. In addition, we design a simple and efficient module for the image spatial domain using dilated convolutions with different receptive fields to alleviate the loss of detail caused by frequent downsampling. We integrate the above parts into an end-to-end dual branch network and design a novel loss committee and an adaptive fusion module to guide the network to flexibly combine spatial and frequency domain features to generate more pleasing visual effects. Finally, we evaluate the proposed network on public benchmarks. Extensive experimental results show that our method outperforms many existing state-of-the-art ones, showing outstanding performance and potential.

研究の動機と目的

  • 標準のCNNが低照度画像強調において高周波数のテクスチャ詳細を保持する能力に限界を示す問題に対処すること。
  • 周波数領域情報、特に位相の意味的特徴を空間領域再構成プロセスに統合し、詳細回復を向上させること。
  • エンコーダ・デコーダアーキテクチャにおける繰り返しダウンサンプリングによる詳細損失を、マルチ受容 field を持つ拡張畳み込みで低減すること。
  • 適応的統合モジュールと新規のフーリエ損失関数を用いて、空間領域と周波数領域の特徴統合をバランスよく行うこと。
  • 実世界の低照度画像およびベンチマークデータセットにおいて、より優れた知覚的品質と頑健性を実現するエンド・ツー・エンドの強調処理を達成すること。

提案手法

  • 位相情報の特徴を活用するため、共有メモリ重みを用いてマグニチュードと位相を動的に組み合わせる、位相に敏感なフーリエ畳み込みモジュールを設計した。
  • 受容 field を拡大し、ダウンサンプリングによる特徴損失を低減するために、異なる率を有する拡張畳み込みを空間ブランチで使用した。
  • 二重ブランチネットワークアーキテクチャを採用し、空間的および周波数的特徴を並列処理することで、局所的およびグローバルな画像特性の共同学習を可能にした。
  • 両ブランチからの特徴を統合する適応的統合モジュールを設計し、入力コンテンツに応じて各ブランチの寄与度を動的に調整した。
  • 訓練をガイドする損失委員会として、SSIM損失、フーリエ損失、および知覚的損失を組み合わせた。SSIMは構造的忠実性を保証し、フーリエ損失は高周波数の詳細認識を向上させ、知覚的損失は自然な出力を改善する。
  • フーリエ損失は、強調画像と正解画像の位相およびマグニチュード成分を比較することで、周波数領域再構成を正則化するように特に設計された。

実験結果

リサーチクエスチョン

  • RQ1位相に敏感なフーリエ畳み込みが、意味論的位相情報を活用することで、低照度画像強調におけるテクスチャ詳細回復を向上させることができるか?
  • RQ2マルチスケール受容 field を持つ拡張畳み込みを用いることで、標準のダウンサンプリングCNNと比較して詳細損失を低減できるか?
  • RQ3二重ブランチネットワークアーキテクチャが、空間領域と周波数領域特徴を効果的に統合し、優れた強調性能を達成できるか?
  • RQ4フーリエ損失および適応的統合モジュールの導入が、強調結果の知覚的品質および安定性にどのように影響するか?
  • RQ5提案手法が、合成ベンチマークを越えて実世界の低照度画像に対してもどの程度一般化可能か?

主な発見

  • LOLデータセットでは、DPFNetはPSNR 24.15 dB、SSIM 0.849を達成し、前回のSOTAであるLLFlowをPSNRで1.23 dB、SSIMで0.012上回った。
  • MIT-5Kデータセットでは、DPFNetはPSNR 25.33 dB、SSIM 0.910を達成し、他の最先端手法を顕著に上回った。
  • アブレーションスタディの結果、位相に敏感なフーリエモジュールの追加により、ベースラインのMDCMと比較して、LOLデータセットでPSNRが2.51 dB向上、MIT-5Kで0.92 dB向上した。
  • 適応的統合モジュールは、LOLデータセットで追加で0.48 dBのPSNR向上を、MIT-5Kで0.49 dBのPSNR向上をもたらし、ドメイン特徴のバランスを取る有効性を示した。
  • 視覚的比較では、DPFNetはBIMEF、LIME、KinD++、LLFlowと比較して、エッジ部や微細なディテール領域においてよりシャープなテクスチャとより少ないアーティファクトを生成した。
  • 損失委員会に知覚的損失を組み込むことで、フーリエ損失単体を使用した場合に見られる過剰強調効果が軽減され、より自然な出力が得られた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。