[論文レビュー] From Darkness to Detail: Frequency-Aware SSMs for Low-Light Vision
ExpoMamba は、周波数に敏感な Mamba ベースのアーキテクチャを提案し、効率的かつ効果的な低照度画像強調を実現する。周波数状態空間ブロック(FSSB)を新規に導入することで、テクスチャの詳細を強化し、混合露出を効果的に管理する。従来モデルと比較して、2〜3倍速い推論(36.6 ms)かつ最大20%高いPSNRを達成し、リアルタイムのエッジデプロイに適している。
Low-light image enhancement remains a persistent challenge in computer vision, where state-of-the-art models are often hampered by hardware constraints and computational inefficiency, particularly at high resolutions. While foundational architectures like transformers and diffusion models have advanced the field, their computational complexity limits their deployment on edge devices. We introduce ExpoMamba, a novel architecture that integrates a frequency-aware state-space model within a modified U-Net. ExpoMamba is designed to address mixed-exposure challenges by decoupling the modeling of amplitude (intensity) and phase (structure) in the frequency domain. This allows for targeted enhancement, making it highly effective for real-time applications, including downstream tasks like object detection and segmentation. Our experiments on six benchmark datasets show that ExpoMamba is up to 2-3x faster than competing models and achieves a 6.8\% PSNR improvement, establishing a new state-of-the-art in efficient, high-quality low-light enhancement. Source code: https://www.github.com/eashanadhikarla/ExpoMamba.
研究の動機と目的
- 低照度画像に存在する露出が不均一な領域(過剰露出と不足露出が共存する)という課題に対処すること。
- トランスフォーマーおよび拡散モデルベースのアーキテクチャがリアルタイムのエッジ応用において計算効率が低く、推論遅延が大きいという問題を克服すること。
- 低照度画像強調においても高い知覚的・構造的品質を維持できる、軽量で効率的なアーキテクチャの開発。
- 動的バッチ学習スキームと振幅・位相成分の適応的処理により、多スケール推論の強靭性を高めること。
提案手法
- 長距離依存関係を効率的にモデル化するため、2次元-Mambaブロックと周波数ドメイン処理を統合した変更済みU-Netを採用。
- 特徴マップを振幅成分と位相成分に分解することで、ターゲット強調が可能な周波数状態空間ブロック(FSSB)を提案。
- 振幅(ノイズ・歪み抑制用)と位相(滑らかさと詳細回復用)の処理に別々の2次元-Mambaブロックを適用。
- 周波数ドメイン処理後に逆フーリエ変換を適用し、空間ドメインの出力を再構築。
- 多様な入力解像度および照明条件にわたる一般化を向上させるために、動的バッチ学習スキームを実装。
- 構造の保持とアーチファクトの回避を目的に、L1、VGG、SSIM、LPIPS、および過剰露出正則化項を組み合わせた複合損失関数を適用。
![Figure 1: [ top: 400x600; bottom: 3840x2160] Scatter plot of model inference time vs. PSNR. Baselines that used ground-truth mean information to produce metrics were reproduced without such information for fairness.](https://ar5iv.labs.arxiv.org/html/2408.09650/assets/x1.png)
実験結果
リサーチクエスチョン
- RQ1周波数に敏感な状態空間モデリングは、計算効率を維持したまま低照度画像強調を改善できるか?
- RQ2周波数ドメインにおける振幅と位相の処理分離は、テクスチャ回復とノイズ抑制をどのように向上させるか?
- RQ3FSSBブロックは、混合露出状況下で、標準的な畳み込みおよびアテンション機構を上回る性能を発揮するか?
- RQ4入力の平均輝度に基づく動的推論調整は、多様な照明条件下での性能向上にどの程度寄与するか?
- RQ5HDRに配慮したコンポーネント(HDR、HDR-CSRNet+)の統合により、低照度強調における過剰露出アーチファクトが顕著に減少するか?
主な発見
- ExpoMamba は LOL-v1 データセットで25.640のPSNRを達成し、競合モデルと比較して15〜20%の向上を示した。
- 推論時間を36.6 msに短縮し、ベースライン手法と比較して2〜3倍速い処理が可能となり、リアルタイム応用に適している。
- FSSBブロックは性能向上に大きく貢献しており、アブレーションスタディではFSSBを含めることでPSNRが2.66 dB向上した。
- 推論時の動的調整(DA)により、PSNRが0.53 dB、SSIMが0.015向上し、入力輝度の変動に対して高い耐性を示した。
- HDR-CSRNet+ は標準的なHDRおよびHDROutレイヤーを上回り、アブレーションスタディで最高のPSNR(25.640)とSSIM(0.860)を達成した。
- L1、VGG、SSIM、LPIPS、および過剰露出正則化損失の組み合わせにより、優れた知覚的品質とアーチファクト抑制が実現した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。