[論文レビュー] Supervised Raw Video Denoising with a Benchmark Dataset on Dynamic Scenes
本論文では、ISO 1600–25600で撮影された55組の動的ノイズあり・ノイズなし動画ペアから構成される新規ベンチマークデータセットを活用した、教師ありの生動画ノイズ除去手法RViDeNetを提案する。Bayerパターンの生動画をRGBGサブシーケンスに分解し、非局所注意機構と時間的融合を用いて空間的・チャネル的・時間的相関を活用することで、生動画およびsRGBドメインにおいて最先端の性能を達成し、従来の動画および画像ノイズ除去モデルを最大1.12 dB向上させるPSNRを達成した。
In recent years, the supervised learning strategy for real noisy image denoising has been emerging and has achieved promising results. In contrast, realistic noise removal for raw noisy videos is rarely studied due to the lack of noisy-clean pairs for dynamic scenes. Clean video frames for dynamic scenes cannot be captured with a long-exposure shutter or averaging multi-shots as was done for static images. In this paper, we solve this problem by creating motions for controllable objects, such as toys, and capturing each static moment for multiple times to generate clean video frames. In this way, we construct a dataset with 55 groups of noisy-clean videos with ISO values ranging from 1600 to 25600. To our knowledge, this is the first dynamic video dataset with noisy-clean pairs. Correspondingly, we propose a raw video denoising network (RViDeNet) by exploring the temporal, spatial, and channel correlations of video frames. Since the raw video has Bayer patterns, we pack it into four sub-sequences, i.e RGBG sequences, which are denoised by the proposed RViDeNet separately and finally fused into a clean video. In addition, our network not only outputs a raw denoising result, but also the sRGB result by going through an image signal processing (ISP) module, which enables users to generate the sRGB result with their favourite ISPs. Experimental results demonstrate that our method outperforms state-of-the-art video and raw image denoising algorithms on both indoor and outdoor videos.
研究の動機と目的
- 動的シーンにおける実際のノイズあり・ノイズなし動画ペアの不足が、生動画ノイズ除去における教師あり学習を妨えているという問題に取り組む。
- 生動画における時間的・空間的・チャネル的相関を効果的に活用することで、優れたノイズ除去性能を実現する手法を開発する。
- 統合されたISPモジュールを介して、生ノイズ除去出力とsRGB出力を両方生成することで、出力の柔軟性を実現する。
- 今後の研究のための再現可能で定量的評価可能なベンチマークを確立する。
提案手法
- 著者らは、静的瞬間に複数回の高ISO露光を撮影し、平均化することでクリアなフレームを生成するように、物体の制御された動きを手動で作成することでベンチマークデータセットを構築した。
- 生動画をBayerパターン構造を保持する4つのRGBGサブシーケンスに分割し、各シーケンスごとの処理を可能にする。
- RViDeNetアーキテクチャは、事前ノイズ除去、フレームアライメント、非局所注意、時間的統合モジュールを適用し、フレーム間の空間的・時間的相関を活用する。
- 非局所注意機構を空間的・チャネル的・時間的次元に適用し、生動画データ内の長距離依存性をモデル化する。
- ノイズ除去済みのRGBGシーケンスを空間的に統合し、学習可能なISPモジュールを通過させてsRGB出力を生成する。これにより、ユーザーのカスタマイズが可能になる。
- ネットワークは、実際のノイズあり・ノイズなし動画ペア上でエンドツーエンドに学習され、生動画およびsRGBの両方の監視信号を用いることで、ノイズ除去と色再現性の共同最適化が可能になる。
実験結果
リサーチクエスチョン
- RQ1動的シーンにおける実際のノイズあり・ノイズなし動画ペアを用いて教師あり学習を実施した場合、優れた動画ノイズ除去性能を達成できるか?
- RQ2生動画における空間的・時間的・チャネルワイドな相関をどれほど効果的に活用できるか。これは、単一フレームやsRGBベースの手法を上回るノイズ除去性能を実現できるか?
- RQ3定量的および定性的な指標において、提案されたRViDeNetは、最先端の動画および生画像ノイズ除去モデルをどの程度上回るか?
- RQ4柔軟なISPモジュールの統合により、再トレーニングなしでユーザーが望むsRGB出力を生成できるか?
- RQ5合成データで微調整した場合、モデルの汎用性はどの程度で、実世界の低照度シーンでも性能を維持できるか?
主な発見
- 実際の地面真値を有する屋内動画では、RViDeNetは生ドメインでPSNR 43.97、SSIM 0.9874を達成し、次善の手法(DIDN)をPSNRで0.72 dB上回った。
- sRGBドメインでは、PSNR 39.95、SSIM 0.9792を達成し、DIDNをPSNRで1.12 dB、EDVRをほぼ1 dB上回った。
- アブレーションスタディの結果、実データで学習した完全なRViDeNetモデルは、合成データでのみ学習したバージョン(Ours⁻)を著しく上回り、有効な一般化能力を示した。
- 視覚的比較では、RViDeNetは細かいディテールを保持しながらノイズをより効果的に除去し、時間的整合性を維持している。一方、EDVR や DIDN は過剰に平滑化された結果を示した。
- 地面真値のない屋外動画におけるユーザースタディでは、RViDeNetがより視覚的に魅力的で、テクスチャ回復が良く、フレアッキングが少ない結果を生成することが確認された。
- ISO 1600–25600の55本の動的動画シーケンスを含む本研究で提案されたデータセットは、教師あり生動画ノイズ除去のための最初の実世界ベンチマークを提供し、再現可能で定量的評価可能な評価を可能にした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。