[論文レビュー] Enhancing Low-Light Images in Real World via Cross-Image Disentanglement
本稿では、ピクセル非整合な現実世界の画像ペアを用いた弱教師付き低照度画像強調手法を提案する。クロス画像分離ネットワーク(CIDN)を導入し、画像間で明るさとコンテンツ特徴を分離することで、照度の向上とノイズ抑制を実現する。本手法は、ピクセル単位の整合性を要しないため、実世界および合成データセットの両方で最先端の性能を達成する。
Images captured in the low-light condition suffer from low visibility and various imaging artifacts, e.g., real noise. Existing supervised enlightening algorithms require a large set of pixel-aligned training image pairs, which are hard to prepare in practice. Though weakly-supervised or unsupervised methods can alleviate such challenges without using paired training images, some real-world artifacts inevitably get falsely amplified because of the lack of corresponded supervision. In this paper, instead of using perfectly aligned images for training, we creatively employ the misaligned real-world images as the guidance, which are considerably easier to collect. Specifically, we propose a Cross-Image Disentanglement Network (CIDN) to separately extract cross-image brightness and image-specific content features from low/normal-light images. Based on that, CIDN can simultaneously correct the brightness and suppress image artifacts in the feature domain, which largely increases the robustness to the pixel shifts. Furthermore, we collect a new low-light image enhancement dataset consisting of misaligned training images with real-world corruptions. Experimental results show that our model achieves state-of-the-art performances on both the newly proposed dataset and other popular low-light datasets.
研究の動機と目的
- 教師あり学習のための大規模でピクセル整合の低照度・通常照度画像ペアの取得という課題に対処すること。
- 実世界の非整合な画像ペアを訓練データとして活用することで、低照度画像強調のロバスト性を向上させること。
- 画像間の明るさ特徴と画像固有のコンテンツ特徴を分離し、明るさ補正とアーティファクト抑制を同時に実現すること。
- 微調整を必要とせず、ノイズや露出の変動がある実世界の状況にも一般化しやすい手法を開発すること。
提案手法
- クロス画像分離ネットワーク(CIDN)は、コンテンツエンコーダーと明るさエンコーダーの2つのエンコーダーを用い、低照度および通常照度画像から分離された特徴を抽出する。
- 明るさ特徴は画像間で共有され、クロス画像明るさ補正が可能となる一方、コンテンツ特徴は構造的一致性を保つために保持される。
- 特徴の交換が適用される:通常照度画像の明るさが、低照度画像のコンテンツ特徴に転送され、照度が向上する。
- コンテンツ一貫性、再構成、 adversarial(対抗的)、知覚的、KLダイバージェンス損失を組み合わせたマルチ損失訓練方式を採用し、訓練の安定化とリアルさの向上を図る。
- 本手法は弱教師あり設定で動作し、ピクセル単位の正確な整合性を要せず、画像レベルの監視情報のみを用いる。
- 後処理として、元の低照度画像に基づくRGBチャンネル強度比の調整により、残存する色歪みを補正する。
実験結果
リサーチクエスチョン
- RQ1ピクセル非整合な現実世界の画像ペアを用いて、完全に整合されたペアの代わりに低照度画像強調を効果的に学習できるか?
- RQ2画像間で分離された特徴学習が、実世界の非整合性やノイズに対してロバスト性を向上させられるか?
- RQ3本手法は、ペア監視がなくとも、非教師付きベースラインより優れたアーティファクトおよびノイズ抑制を達成できるか?
- RQ4微調整なしで露出補正タスクに一般化できるか?
- RQ5大規模な非整合データセットの使用が、モデルの一般化性能および性能にどのように影響するか?
主な発見
- 提案されたCIDNモデルは、新たに導入されたNM2LデータセットおよびLOLなどの公開低照度データセットの両方で最先端の性能を達成した。
- Zero-DCE や EnlightenGAN などの非教師付き手法に比べ、ノイズ抑制において顕著に優れており、強調結果におけるアーティファクトの増幅を回避した。
- NM2Lデータセットで学習させることで、LOL単体での学習に比べ、低品質・ノイズの多い入力でもより優れた性能が得られた。これは、実世界の劣化要因が組み込まれたためである。
- LOLとNM2Lデータセットを組み合わせて学習させることでさらなる性能向上が得られ、露出やノイズ状態が異なる多様な訓練データの恩恵が示された。
- 微調整なしで過露出補正にも一般化でき、困難なケースではPhotoshopと同等の結果を出力した。
- 定量的評価では、非参照ベンチマークにおいてFID、LPIPS、PSNRの各指標が向上し、画像品質およびリアルさの向上を確認した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。