[論文レビュー] First image then video: A two-stage network for spatiotemporal video denoising
本稿では、空間的ノイズと時間的ノイズを分離して処理する2段階の深層学習フレームワーク、FITVNetを提案する。まず、フレーム内ノイズを低減するために画像ノイズ除去を適用し、その後で空間時間的ノイズ除去を実行する。空間的および時間的ノイズ低減を分離することで、Vimeo90Kで最先端のPSNRおよびSSIMスコアを達成するとともに、TOFlowより5倍以上高速に動作し、教師ありベースラインと同等の性能を示す競争力のある自己教師付きバージョンを実現した。
Video denoising is to remove noise from noise-corrupted data, thus recovering true signals via spatiotemporal processing. Existing approaches for spatiotemporal video denoising tend to suffer from motion blur artifacts, that is, the boundary of a moving object tends to appear blurry especially when the object undergoes a fast motion, causing optical flow calculation to break down. In this paper, we address this challenge by designing a first-image-then-video two-stage denoising neural network, consisting of an image denoising module for spatially reducing intra-frame noise followed by a regular spatiotemporal video denoising module. The intuition is simple yet powerful and effective: the first stage of image denoising effectively reduces the noise level and, therefore, allows the second stage of spatiotemporal denoising for better modeling and learning everywhere, including along the moving object boundaries. This two-stage network, when trained in an end-to-end fashion, yields the state-of-the-art performances on the video denoising benchmark Vimeo90K dataset in terms of both denoising quality and computation. It also enables an unsupervised approach that achieves comparable performance to existing supervised approaches.
研究の動機と目的
- 高速移動物体の境界に生じるモーションブラーのアーチファクトを軽減すること。
- 高スピードの動きと空間的ノイズを同時に処理に苦しむ、エンドツーエンドの空間時間的ノイズ除去器の限界を克服すること。
- 空間的ノイズ除去と時間的ノイズ除去を分離することで、より高いロバスト性と性能を実現する2段階フレームワークを設計すること。
- 1段階目の画像ノイズ除去器を自己教師信号として活用することで、2段階目に対する自己教師学習を可能にし、自己教師付き動画ノイズ除去アプローチを実現すること。
- フローベースの手法と比較して、顕著に高速化された推論時間で最先端のノイズ除去品質を達成すること。
提案手法
- 本手法は2段階のニューラルネットワークを採用する。まず、各フレームを独立して処理する画像間ノイズ除去モジュールがフレーム内ノイズを低減する。
- 2段階目では、ノイズ低減済みフレームを対象に、標準的な空間時間的ノイズ除去ネットワーク(FastDVDNetに基づく)を適用し、フレーム間相関を活用する。
- 全ネットワークは、空間的および空間時間的監視信号をバランスよく組み合わせた損失関数を用いてエンドツーエンドで訓練される。
- 自己教師付きバージョンでは、2段階目の清澄フレームの監視を、1段階目のノイズ除去器の出力に置き換えることで、自己教師学習を可能にする。
- 1段階目のネットワークは、細部やテクスチャを保持するため、知覚的損失とピクセル単位の局所的ノイズ除去損失を用いて訓練される。
- 本フレームワークは、ガウスノイズおよび実世界ノイズを含むさまざまなノイズレベルを想定し、Vimeo90Kベンチマークで評価されている。
実験結果
リサーチクエスチョン
- RQ1空間的ノイズ除去と時間的ノイズ除去の段階を分離することで、高速移動する動画シーケンスにおける物体境界の鋭さ回復が向上するか?
- RQ2事前に画像ノイズ除去を行うことで、その後の空間時間的動画ノイズ除去の性能と安定性にどのような影響を与えるか?
- RQ3フローベースの手法と比較して顕著に高速化されつつ、2段階ネットワークが最先端の動画ノイズ除去性能を達成できるか?
- RQ41段階目が強力な事前知識を提供する場合、完全に自己教師学習の戦略が動画ノイズ除去に有効に機能するか?
- RQ52段階設計が、高ノイズレベルや困難な運動条件に対するロバスト性を向上させるか?
主な発見
- FITVNetは、テストされたすべてのノイズレベルでVimeo90Kデータセットにおいて最先端のPSNRおよびSSIMスコアを達成し、FastDVDNetおよびTOFlowを上回った。
- TOFlowより5倍以上高速に動作しながらも、優れたノイズ除去品質を維持しており、計算効率の顕著な向上を示した。
- FITVNetの自己教師付きバージョンは、清澄フレームの監視が一切ないにもかかわらず、教師あり最先端手法であるFastDVDNetと同等の性能を達成した。
- 視覚的結果から、FITVNetはTOFlowやFastDVDNetがぼやけた出力を生成する高速移動シナリオでも、物体境界をより鋭く保持していることが確認された。
- 1段階目のノイズ除去器は空間的ノイズを効果的に低減し、2段階目のネットワークが動きのモデリングに集中できるようにしたことが、特徴可視化およびアブレーションスタディで裏付けられた。
- 空間的および知覚的損失を併用した変種(FITVNet + jsc)は、すべてのノイズレベルで安定した性能を示したが、ベースモデルは低ノイズ(Gauss15)で困難を示し、エンドツーエンド訓練におけるノイズ分布への感受性が顕在した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。