Skip to main content
QUICK REVIEW

[論文レビュー] Spatially Adaptive Self-Supervised Learning for Real-World Image Denoising

Junyi Li, Zhilu Zhang|arXiv (Cornell University)|Mar 27, 2023
Image and Signal Denoising Methods被引用数 4
ひとこと要約

本稿では、平坦領域とテクスチャ領域を別々に処理する空間的に適応する自己教師付き学習フレームワークを提案し、平坦領域には盲隠し近傍ネットワーク(BNN)を、テクスチャ領域には局所的に注意を向けるネットワーク(LAN)を用いる。平坦領域では非隣接ピクセルからのノイズ不変の監視を、テクスチャ領域では隣接ピクセルからのコンテンツに適応した監視を導出することで、ピクセルシャッフルによるダウンサンプリングを回避し、アリゼーションアーチファクトを防ぎ、SIDDおよびDNDデータセットにおいて定量的指標と知覚的品質の両方を向上させ、最先端の性能を達成する。

ABSTRACT

Significant progress has been made in self-supervised image denoising (SSID) in the recent few years. However, most methods focus on dealing with spatially independent noise, and they have little practicality on real-world sRGB images with spatially correlated noise. Although pixel-shuffle downsampling has been suggested for breaking the noise correlation, it breaks the original information of images, which limits the denoising performance. In this paper, we propose a novel perspective to solve this problem, i.e., seeking for spatially adaptive supervision for real-world sRGB image denoising. Specifically, we take into account the respective characteristics of flat and textured regions in noisy images, and construct supervisions for them separately. For flat areas, the supervision can be safely derived from non-adjacent pixels, which are much far from the current pixel for excluding the influence of the noise-correlated ones. And we extend the blind-spot network to a blind-neighborhood network (BNN) for providing supervision on flat areas. For textured regions, the supervision has to be closely related to the content of adjacent pixels. And we present a locally aware network (LAN) to meet the requirement, while LAN itself is selectively supervised with the output of BNN. Combining these two supervisions, a denoising network (e.g., U-Net) can be well-trained. Extensive experiments show that our method performs favorably against state-of-the-art SSID methods on real-world sRGB photographs. The code is available at https://github.com/nagejacob/SpatiallyAdaptiveSSID.

研究の動機と目的

  • 現存する自己教師付き画像デノイジング(SSID)手法が、リアルワールドのsRGB画像における空間相関を持つノイズを処理する能力に制限を受ける問題に対処すること。
  • ピクセルシャッフルによるダウンサンプリングが画像情報の破壊を引き起こし、アリゼーションアーチファクトを生じるという欠点を克服すること。
  • クリアなノイズペアを必要とせず、局所的な画像特徴(平坦 vs. テクスチャ領域)に応じて監視を適応的に変更する手法を開発すること。
  • 非隣接ピクセルからの監視と隣接ピクセルからの監視をそれぞれ空間的に適応的に活用することで、デノイジング性能と効率性を向上させること。
  • コンテンツに適応した監視とノイズに強い監視の二重の監視信号を用いて、U-Netベースのデノイジングネットワークを訓練すること。

提案手法

  • ノイズに相関するピクセルを除外するように盲領域を拡張した盲隠し近傍ネットワーク(BNN)を導入し、盲隠しネットワーク(BSN)を拡張することで、平坦領域における信頼性の高い監視を可能にする。
  • BNNの出力を平坦領域を検出するためのプロキシとして用い、高い分散を示す領域を平坦領域と特定し、それらを局所的に注意を向けるネットワーク(LAN)の監視に活用する。
  • 隣接ピクセルを活用してテクスチャディテールを回復する局所的に注意を向けるネットワーク(LAN)を提案し、平坦領域ではBNNの出力によって監視が選択的にガイドされる。
  • 空間的に融合するための適応的係数αを用いて、BNNとLANの出力を空間的に融合し、局所的な画像構造を尊重するハイブリッド監視信号を生成する。
  • 融合された空間的に適応する監視信号を用いてU-Netベースのデノイジングネットワークを訓練し、推論時にはBNNとLANを分離する。
  • 学習されたαを用いた空間的に適応する融合戦略を採用し、画像全体の融合を避けることで性能の低下と推論時間の増加を防ぐ。

実験結果

リサーチクエスチョン

  • RQ1空間的に適応する監視は、空間相関を持つノイズを有するリアルワールドのsRGB画像における自己教師付きデノイジングを改善できるか?
  • RQ2平坦領域とテクスチャ領域は、自己教師付きデノイジングフレームワーク内でどのように区別され、別々に処理されるべきか?
  • RQ3盲隠し近傍ネットワークは、画像構造を損なうことなく、平坦領域におけるノイズ相関を効果的に抑制できるか?
  • RQ4局所的に注意を向けるネットワークは、平坦領域からの適応的監視を学習することで、隣接ピクセルを活用してテクスチャディテールを回復できるか?
  • RQ5空間的に適応する監視の融合は、画像レベルの融合に比べてデノイジング品質と推論効率の両面で優れているか?

主な発見

  • 提案手法はDNDデータセットにおいて37.39 dBのPSNRを達成し、CVF-SID や AP-BSN+R3 といった最先端の自己教師付き手法を上回る性能を示した。
  • アブレーションスタディの結果、BNNとLANの両方の監視を組み合わせた場合が最良の性能(37.39 dB)を示し、個々のモジュールが顕著な貢献をしていることが確認された。
  • BNNの最適な盲隠しサイズは9×9であり、ノイズに相関するすべてのピクセルを効果的に除外しつつ、信号の整合性を保った。
  • 局所的に注意を向けるネットワーク(LAN)は、3×3の局所受容野でピーク性能を発揮し、ディテール回復とぼかしの回避の両立に成功した。
  • 空間的に適応する融合戦略により、推論時間を4.8 msに短縮し、画像レベルの融合(22.9 ms)に比べて顕著に高速化され、PSNRも0.55 dB向上した。
  • 視覚的比較では、提案手法がベースライン手法に比べてよりクリアな結果を生成し、繊細なテクスチャの保持が顕著に改善され、ぼかしが少なくなることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。