[論文レビュー] Efficient Multi-Stage Video Denoising with Recurrent Spatio-Temporal Fusion
本稿では、学習可能で可逆な変換を用いて計算複雑度を低減しつつ、性能を維持または向上させる、再帰的空間時間融合を活用した効率的なマルチステージ動画ノイズ除去フレームワークであるEMVDを提案する。時間的融合、空間的ノイズ除去、精練ステージを変換領域で適用することにより、EMVDは5.38 GFLOPsおよび36msの推論時間でモバイルSoC上でリアルタイムの720p動画ノイズ除去を実現し、364倍も高い複雑度を持つ最先端手法でさえも上回る性能を発揮する。
In recent years, denoising methods based on deep learning have achieved unparalleled performance at the cost of large computational complexity. In this work, we propose an Efficient Multi-stage Video Denoising algorithm, called EMVD, to drastically reduce the complexity while maintaining or even improving the performance. First, a fusion stage reduces the noise through a recursive combination of all past frames in the video. Then, a denoising stage removes the noise in the fused frame. Finally, a refinement stage restores the missing high frequency in the denoised frame. All stages operate on a transform-domain representation obtained by learnable and invertible linear operators which simultaneously increase accuracy and decrease complexity of the model. A single loss on the final output is sufficient for successful convergence, hence making EMVD easy to train. Experiments on real raw data demonstrate that EMVD outperforms the state of the art when complexity is constrained, and even remains competitive against methods whose complexities are several orders of magnitude higher. Further, the low complexity and memory requirements of EMVD enable real-time video denoising on commercial SoC in mobile devices.
研究の動機と目的
- モバイルデバイスへのリアルタイムデプロイメントを妨げる、最先端の深層学習ベースの動画ノイズ除去手法の高い計算複雑度に対処すること。
- モデルの複雑度を犠牲にせずに性能を維持するため、構造的なマルチステージ処理パイプラインを通じて動画内の空間時間的相関を活用すること。
- 各ステージが明示的な監視なしに自然に収束するトレーニングに適したアーキテクチャを設計することで、解釈可能性と制御可能性を向上させること。
- 最小限のメモリフットプリントで商業用モバイルSoC上でリアルタイム推論を達成しつつ、競争力のあるPSNRおよびSSIMスコアを維持すること。
提案手法
- EMVDは、時間的融合、空間的ノイズ除去、空間時間的精錬という3段階のアーキテクチャを採用しており、各ステージは学習可能で可逆な線形作用素から導かれる変換領域表現上で動作する。
- 時間的融合ステージは、再帰的メカニズムを用いて過去のフレームを再帰的に組み合わせ、ノイズを低減した後にノイズ除去を実行する。
- 空間的ノイズ除去ステージは、変換領域における統合フレームにCNNベースのノイズ除去器を適用し、残存ノイズを除去する。
- 精錬ステージは、空間時間的コンテキストを用いて適応的に強化することで、高周波数成分の復元を実現する。
- すべてのステージは、色成分と周波数成分の相関を低減させ、正確性を向上させるとともに複雑度を削減する、共有で学習可能で可逆な変換を使用する。
- 個々のステージに補助的監視を必要とせず、最終出力での一括エンドツーエンド損失により、効果的な学習が可能になる。
実験結果
リサーチクエスチョン
- RQ1既存の深層学習手法と比較して、著しく低い計算複雑度で最先端の性能を達成できるマルチステージ動画ノイズ除去フレームワークは実現可能か?
- RQ2再帰的空間時間融合メカニズムは、非再帰的マルチフレーム手法と比較して、長期的な時間的整合性と性能においてどのように差をつけるか?
- RQ3学習可能で可逆な変換は、動画ノイズ除去においてモデルの正確性と効率性の両面でどの程度向上をもたらすか?
- RQ4このような軽量アーキテクチャは、顕著な品質劣化を伴わず、商業用モバイルSoC上でリアルタイム性能を達成できるか?
主な発見
- CRVDデータセットにおいて、EMVDは5.38 GFLOPsで38.27 dBのPSNRおよび0.9722のSSIMを達成し、5.7倍も複雑度が低いにもかかわらずEDVR(37.43 dB)およびFastDVDnetを上回る性能を発揮する。
- 5.38 GFLOPsの条件下で、EMVDは79 GFLOPsのRViDeNetを0.84 dBのPSNR向上で上回り、Huawei P40 Proスマートフォン上では6.5倍のメモリ使用量削減と4.9倍の高速化を達成する。
- 25倍も大きなRViDeNetモデルと比較しても、EMVDは0.03 dBのPSNR優位性を維持しており、低複雑度でも優れた性能効率を示している。
- SRVDデータセットでは、EMVDは時間的安定性に優れ、特に長時間のシーケンスにおいて、マルチフレームベースラインと比較してより高いPSNR向上を達成する。
- 商業用モバイルSoC(Huawei P40 Pro)上では、EMVDは約30 fpsのリアルタイム性能を達成し、720p動画をわずか36 msで処理し、DDRメモリ使用量は112 MBにとどまる。
- モデルの再帰的設計により、動的シーンにおいても収束が速く、数フレーム処理後には他の手法を2 dB以上のPSNR向上で上回る。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。