Skip to main content
QUICK REVIEW

[論文レビュー] Diffusion in the Dark: A Diffusion Model for Low-Light Text Recognition

Cindy M. Nguyen, Eric R. Chan|arXiv (Cornell University)|Mar 7, 2023
Image and Signal Denoising Methods被引用数 5
ひとこと要約

本稿では、テキスト認識に不可欠な高周波数ディテールを保持する、暗所における画像再構築のための条件付き拡散モデルであるDiffusion in the Dark (DiD)を提案する。ノイズの多い暗所パッチで学習されたDiDは、タスク固有の微調整なしに最先端の手法を上回り、実世界の暗所条件下でもSOTAの定量的結果と優れたディテール回復を達成する。

ABSTRACT

Capturing images is a key part of automation for high-level tasks such as scene text recognition. Low-light conditions pose a challenge for high-level perception stacks, which are often optimized on well-lit, artifact-free images. Reconstruction methods for low-light images can produce well-lit counterparts, but typically at the cost of high-frequency details critical for downstream tasks. We propose Diffusion in the Dark (DiD), a diffusion model for low-light image reconstruction for text recognition. DiD provides qualitatively competitive reconstructions with that of state-of-the-art (SOTA), while preserving high-frequency details even in extremely noisy, dark conditions. We demonstrate that DiD, without any task-specific optimization, can outperform SOTA low-light methods in low-light text recognition on real images, bolstering the potential of diffusion models to solve ill-posed inverse problems.

研究の動機と目的

  • 高レベルのビジョンタスク、特にテキスト認識において、既存の手法が高周波数ディテールを保持できないという課題に対処すること。
  • 極度に暗くノイズの多い画像においても、美観的品質と構造的整合性を維持する再構築手法を開発すること。
  • 特に高周波数ディテールが重要である状況において、拡散モデルが低照度画像処理における不定な逆問題を解く可能性を探ること。
  • 拡散モデルが低信号環境下で、GAN やオートエンコーダーよりも微細なテクスチャーやエッジをよりよく再構築できることを示すこと。
  • 再トレーニングなしに多様な実世界の低照度シナリオに一般化可能な、計算効率の良い手法を提供すること。

提案手法

  • DiDは、低照度画像のクロップドパッチを用いて学習した条件付き拡散モデルであり、高周波数ディテールを保持しながら、フル解像度の明るい出力を再構築する。
  • 極度に低い信号対ノイズ比を持つ低照度データに適応したノイズスケジューリングを備えたU-Netアーキテクチャとスキップ接続を採用する。
  • 右裾が長い暗所画像分布における学習を安定化させるために、テール正規化とHSV空間におけるVチャンネルの適応的リスケーリングといったキーナルミネーションを導入する。
  • 計算コストを削減するため、事前学習済みのVAEを用いた潜在空間でのノイズ除去を活用する潜在拡散を採用する。
  • 実世界の光子不足状態を模倣するため、ポisson-ガウスノイズを含む合成低照度データ上で、エンドツーエンドに学習する。
  • 推論は、低照度入力を条件として、ランダムノイズからの反復的ノイズ除去によって行われ、高忠実度の再構築を生成する。
Figure 2 : Overview of DiD pipeline. During training, we randomly crop $32\times 32$ patches at multiple scales (noted with $s$ ) using Single Patchify and concatenate the low-light patches, low-resolution well-lit patches, and high-resolution well-lit patches together as conditioning images to deno
Figure 2 : Overview of DiD pipeline. During training, we randomly crop $32\times 32$ patches at multiple scales (noted with $s$ ) using Single Patchify and concatenate the low-light patches, low-resolution well-lit patches, and high-resolution well-lit patches together as conditioning images to deno

実験結果

リサーチクエスチョン

  • RQ1拡散モデルは、従来の最先端の低照度強調手法よりも、極めて暗くノイズの多い画像における高周波数ディテールをよりよく再構築できるか?
  • RQ2拡散ベースのアプローチは、タスク固有の微調整なしに、構造的整合性とテキストの可読性を保持できるか?
  • RQ3グランドトゥルースの明るい画像を欠いた実世界の低照度データセットにおいて、DiDはどの程度の性能を示すか?
  • RQ4極めて歪んだ暗所画像分布における拡散学習を安定化させるために、どのような正規化技術が必要か?
  • RQ5DiDは、未知の実際の低照度シーンに一般化可能であり、美観的品質と認識性能の両方を維持できるか?

主な発見

  • SVT-Perspectiveデータセットにおいて、DiDは低照度条件下でPSNR 21.00を達成し、次善の手法(KID: 0.14 vs. 0.15)を上回り、語彙精度と編集距離指標においてもSOTAを上回った。
  • ICDAR2013データセットでは、0.4×の明るさと高ノイズ条件下で、語彙精度89.2%、正規化編集距離0.82を達成し、ベースラインモデルを上回った。
  • 定性的な結果では、DiDは極度に劣化した画像においても微細なテキストエッジや文字のディテールを回復している一方、LLFlow や LDM はぼやけたまたは現実的でない再構築を生成した。
  • DiDは実世界のDarkFaceデータに対しても高品質な再構築を維持しており、LLFlow が見られる不自然な赤みがかったトーンを回避し、未知の実際の低照度シーンに対しても頑健であることを示した。
  • アブレーションスタディにより、条件付きU-NetにILVRと適切な正規化が不可欠であることが確認された:ILVRを除去するとPSNRが2.75ポイント低下し、正規化を省略すると性能が著しく低下した。
  • タスク固有の微調整なしに、DiDは下流のテキスト認識タスクにおいてSOTAの低照度手法を上回った。これは、拡散モデルが高周波数再構築に一般化可能であることを証明している。
Figure 3 : Color pixel distributions for low-light data. Right-tailed data do not follow assumptions made in training a diffusion model. We normalize the data to the appropriate range for training. Top: Data distribution of a random selection of 30 images from the LOL training set [ 89 ] . Middle: D
Figure 3 : Color pixel distributions for low-light data. Right-tailed data do not follow assumptions made in training a diffusion model. We normalize the data to the appropriate range for training. Top: Data distribution of a random selection of 30 images from the LOL training set [ 89 ] . Middle: D

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。