[論文レビュー] Joint tone mapping and denoising of thermal infrared images via multi-scale Retinex and multi-task learning
本稿では、マルチスケールリティナス最適化と自己教師付きマルチタスクU-Netディープラーニングモデルを用いて、16ビットの熱赤外(TIR)画像のための統合トーンマッピングおよびノイズ除去フレームワークを提案する。この手法は、トーンマッピング、ノイズ除去、およびデフレィクティングを同時に学習することで、FLIR ADASデータセットにおいて最先端の性能を達成し、TMQIが0.934に達し、ノイズの可視性と時間的不整合性が低減された。
Cameras digitize real-world scenes as pixel intensity values with a limited value range given by the available bits per pixel (bpp). High Dynamic Range (HDR) cameras capture those luminance values in higher resolution through an increase in the number of bpp. Most displays, however, are limited to 8 bpp. Naive HDR compression methods lead to a loss of the rich information contained in those HDR images. In this paper, tone mapping algorithms for thermal infrared images with 16 bpp are investigated that can preserve this information. An optimized multi-scale Retinex algorithm sets the baseline. This algorithm is then approximated with a deep learning approach based on the popular U-Net architecture. The remaining noise in the images after tone mapping is reduced implicitly by utilizing a self-supervised deep learning approach that can be jointly trained with the tone mapping approach in a multi-task learning scheme. Further discussions are provided on denoising and deflickering for thermal infrared video enhancement in the context of tone mapping. Extensive experiments on the public FLIR ADAS Dataset prove the effectiveness of our proposed method in comparison with the state-of-the-art.
研究の動機と目的
- 16ビットの高ダイナミックレンジ(HDR)熱赤外(TIR)画像を、通常の8ビットディスプレイに表示する際、知覚的な詳細を損なわず可視化する課題に対処すること。
- TIR動画シーケンスにおいて、トーンマッピング、ノイズ低減、時間的整合性の最適化を統合的に最適化することで、画像品質を向上させること。
- ペaired noisy-cleanデータを必要とせず、自己教師付き学習によって暗黙的にノイズ除去を実行するディープラーニングベースのトーンマッピングソリューションを構築すること。
- パラメータ最適化とU-Netアーキテクチャによる近似によって、TIR用に最適化された伝統的なマルチスケールリティナス(MSR)の性能を向上させること。
- 公開済みのFLIR ADASデータセットを用いて、本手法を包括的に評価し、最先端のTIRトーンマッピングアルゴリズムと比較すること。
提案手法
- トーンマッピングのためのベースラインとして、対比強調とデフレイクティングに焦点を当てた最適化されたマルチスケールリティナス(MSR)アルゴリズムを開発する。
- 最適化されたMSRの出力を、完全に教師ありの方法でU-Netベースのディープコンvolutionニューラルネットワーク(DCNN)の教師データとして用い、トーンマッピングの挙動を模倣する。
- 入力画像に合成ノイズを追加することで、トレーニングプロセスに自己教師付きノイズ除去を組み込み、トーンマッピングと同時に暗黙的にノイズ除去を学習できるようにする。
- フレーム間の強度変動をペナルティとする時間的正則化損失項を導入することで、動画シーケンスにおける時間的整合性を向上させ、フレイクティングを低減する。
- ネットワーク全体をマルチタスク学習スキームでエンドツーエンドにトレーニングし、トーンマッピング、ノイズ除去、およびデフレイクティングの目的を同時に最適化する。
- エンコーダ・デコーダ構造により、効果的な特徴抽出と高解像度出力生成が可能となるため、U-Netアーキテクチャを活用する。
実験結果
リサーチクエスチョン
- RQ1最適化されたマルチスケールリティナスアルゴリズムは、16ビットの熱赤外画像におけるトーンマッピングのための有効なベースラインとして機能するか?
- RQ2MSR出力に基づいてトレーニングされたディープラーニングモデルは、ノイズ除去を併せて行えるようにしながら、トーンマッピング挙動をどれほど正確に再現できるか?
- RQ3マルチタスクフレームワーク内でトーンマッピングと同時に学習された自己教師付きノイズ除去は、ノイズの可視性をどれほど効果的に低減できるか?
- RQ4時間的正則化の導入により、TIR動画シーケンスにおけるグローバルおよびローカルの時間的整合性が向上するか?
- RQ5本手法は、既存の最先端のTIRトーンマッピングアルゴリズムと比較して、定量的および定性的にどの程度優れているか?
主な発見
- 最適化されたMSRベースラインは、標準MSRよりも顕著にトーンマッピング品質を向上させ、TMQIが0.923に達し、過露出および過小露出の指標が低減された。
- ディープラーニングベースのアプローチ(「Learned MSR」と命名)は、TMQIが0.934に達し、FLIR(0.951)やRealtime TMO(0.809)を含む、比較対象のすべての手法を上回った。
- 自己教師付きノイズ除去を統合したトレーニングにより、ノイズの可視性が30.67から26.49に低下し、効果的な暗黙的ノイズ抑制が確認された。
- グローバルな時間的不整合性は5.7e-6にまで低減され、最適化されたMSR(2e-5)や他のベースラインよりも顕著に改善され、効果的なデフレイクティングが示された。
- ローカルな時間的不整合性についても低減され、最終手法は0.0258を達成し、動画シーケンスにおけるフレームの一貫性が向上した。
- 定性的な結果から、本手法が微細なディテールとコントラストを保持しながら、ノイズとフレイクティングを最小限に抑えることが確認された。特にズームイン比較で顕著に顕在化した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。