[論文レビュー] A Convolutional Neural Network-Based Low Complexity Filter
本稿では、深度分離畳み込み(DSC)とバッチ正規化を用いて計算複雑性を低減する、軽量な畳み込みニューラルネットワーク(CNN)ベースのループ内フィルタを提案する。新たなフレームレベルの残差マッピング(RM)モジュールを導入することで、インターフレームにおける過剰な平滑化を軽減し、一般化性能を向上させ、HEVCおよびVVC基準で強力な性能を維持しながら、VR-CNNと比較して1.2%のBDレート低減および79.1%のFLOPs削減を達成した。
Convolutional Neural Network (CNN)-based filters have achieved significant performance in video artifacts reduction. However, the high complexity of existing methods makes it difficult to be applied in real usage. In this paper, a CNN-based low complexity filter is proposed. We utilize depth separable convolution (DSC) merged with the batch normalization (BN) as the backbone of our proposed CNN-based network. Besides, a weight initialization method is proposed to enhance the training performance. To solve the well known over smoothing problem for the inter frames, a frame-level residual mapping (RM) is presented. We analyze some of the mainstream methods like frame-level and block-level based filters quantitatively and build our CNN-based filter with frame-level control to avoid the extra complexity and artificial boundaries caused by block-level control. In addition, a novel module called RM is designed to restore the distortion from the learned residuals. As a result, we can effectively improve the generalization ability of the learning-based filter and reach an adaptive filtering effect. Moreover, this module is flexible and can be combined with other learning-based filters. The experimental results show that our proposed method achieves significant BD-rate reduction than H.265/HEVC. It achieves about 1.2% BD-rate reduction and 79.1% decrease in FLOPs than VR-CNN. Finally, the measurement on H.266/VVC and ablation studies are also conducted to ensure the effectiveness of the proposed method.
研究の動機と目的
- 動画符号化における既存の学習ベースのループ内フィルタの高い計算複雑性に対処すること。
- 性能を損なわずモデルの複雑性を低減し、リソース制約のあるプラットフォームへの展開を可能にすること。
- 最小残留値を持つブロックの繰り返しフィルタリングによって引き起こされるインターフレームにおける過剰な平滑化問題を解決すること。
- 統一的で軽量なアーキテクチャを用いて、イントラおよびインターフレーム間での学習ベースのフィルタの一般化を向上させること。
- 効率的な統合を通じて、HEVCおよびVVCなどの既存の動画符号化基準との互換性を実現すること。
提案手法
- 提案されたフィルタのボトムアップには、FLOPsとモデルサイズの低減を目的とした、深度分離畳み込み(DSC)とバッチ正規化(BN)の統合を採用した。
- 学習された残差からの歪みを回復させるために、フレームレベルの残差マッピング(RM)モジュールを新たに導入し、一般化性能の向上とインターフレームにおける過剰な平滑化の低減を実現した。
- 収束の加速と学習安定性の向上を目的として、注意力伝達(AT)を用いた知識蒸留によるパラメータ初期化を実施した。
- 同じネットワークをイントラおよびインターフレームの両方で適用することで、別々のモデルを用意する必要を排除し、ストレージオーバーヘッドを削減した。
- モデルは全量のDIV2Kデータセットで学習され、H.266/VVC互換性を確認するためVTM-6.3で評価された。
- アブレーションスタディにより、RMおよびパラメータ初期化の有効性がHEVCおよびVVCのテストシーケンスで検証された。
実験結果
リサーチクエスチョン
- RQ1VR-CNNなどの既存手法と比較して、顕著にFLOPsを削減しつつ、競争力のあるBDレート性能を達成できる軽量なCNNベースのループ内フィルタは実現可能か?
- RQ2提案されたフレームレベルの残差マッピング(RM)モジュールは、インターフレームにおける過剰な平滑化を低減すると同時に、一般化性能を向上させるのにどの程度効果的か?
- RQ3注意力伝達(AT)を用いた知識蒸留は、学習性能および収束速度をどの程度向上させるか?
- RQ41つの統一されたネットワークが、性能劣化を伴わずにイントラおよびインターフレームの両方を効果的に処理できるか?
- RQ5最新のH.266/VVC基準において、提案されたフィルタはHEVCベンチマークと比較してどの程度の性能を示すか?
主な発見
- 提案手法は、HEVCテストシーケンスにおいて、VR-CNNの基準と比較して約1.2%のBDレート低減および79.1%のFLOPs削減を達成した。
- H.266/VVCにおいては、AI設定ではラミナンス成分で約1.6%、RA設定では1.5%のBDレート低減を達成した。
- RMモジュールはテストシーケンス全体で平均して0.8%のBDレート性能向上をもたらし、ClassCシーケンスでは最大1.9%の向上を示した。
- 注意力伝達(AT)を用いたパラメータ初期化により、チャネル成分(V)では0.328 dB、ラミナンス(Y)では0.329 dBのPSNR向上が、ベースラインの学生モデルと比較して得られた。
- アブレーションスタディにより、RMモジュールが特に高密度テクスチャを有するシーケンスにおいてインターフレーム性能を顕著に向上させることが確認された。
- エンコードの複雑性はわずかに増加する一方、デコードの複雑性は約3倍に増加するのみで、実世界の展開に実用的であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。