Skip to main content
QUICK REVIEW

[論文レビュー] A practical convolutional neural network as loop filter for intra frame

Xiaodan Song, Jiabao Yao|arXiv (Cornell University)|May 16, 2018
Advanced Vision and Imaging参考文献 7被引用数 8
ひとこと要約

本論文は、再構築と量子化パrameter (QP) を入力として統合することで、あらゆる品質レベルに普遍的に適用可能な、QPに依存しない一括型畳み込みニューラルネットワーク (CNN) ループフィルタを提案する。モデル圧縮と動的固定小数点 (DFP) 推論を組み合わせることで、プラットフォーム間で一貫したパフォーマンスを実現するとともに、冗長性を低減し、すべてのイントラフレーム設定において、JEM 7.0 と比較してラマ成分で 3.14%、クロマ成分で 5.21% および 6.28% のBDレート削減を達成する。

ABSTRACT

Loop filters are used in video coding to remove artifacts or improve performance. Recent advances in deploying convolutional neural network (CNN) to replace traditional loop filters show large gains but with problems for practical application. First, different model is used for frames encoded with different quantization parameter (QP), respectively. It is expensive for hardware. Second, float points operation in CNN leads to inconsistency between encoding and decoding across different platforms. Third, redundancy within CNN model consumes precious computational resources. This paper proposes a CNN as the loop filter for intra frames and proposes a scheme to solve the above problems. It aims to design a single CNN model with low redundancy to adapt to decoded frames with different qualities and ensure consistency. To adapt to reconstructions with different qualities, both reconstruction and QP are taken as inputs. After training, the obtained model is compressed to reduce redundancy. To ensure consistency, dynamic fixed points (DFP) are adopted in testing CNN. Parameters in the compressed model are first quantized to DFP and then used for inference of CNN. Outputs of each layer in CNN are computed by DFP operations. Experimental results on JEM 7.0 report 3.14%, 5.21%, 6.28% BD-rate savings for luma and two chroma components with all intra configuration when replacing all traditional filters.

研究の動機と目的

  • 既存のCNNベースのループフィルタがQPごとに別々のモデルを必要とし、ハードウェアコストが高くなるという制限を解消すること。
  • CNNにおける浮動小数点演算が原因で生じる推論におけるプラットフォーム非一貫性を解消すること。
  • 構造的圧縮と量子化を用いて、モデルの冗長性と計算コストを低減すること。
  • 異なるQPレベルと再構築品質に一般化可能な、単一で頑健なCNNフィルタを開発すること。
  • 動的固定小数点 (DFP) 推論を用いて、さまざまなハードウェアプラットフォーム間で一貫したエンコード・デコード動作を保証すること。

提案手法

  • 残差構造を有するCNNが、再構築済みイントラフレームとQP値の両方を入力とすることで、1つのモデルで複数のQPレベルを処理可能となる。
  • モデル圧縮は2段階で実施する:(1) バッチ正規化のスケールパラメータにL1正則化を適用し、トレーニング中にフィルタをプルーニングする。 (2) ファインチューニングを伴う低ランク近似を用いて、さらにパラメータの冗長性を低減する。
  • 圧縮後、モデル重みは動的固定小数点 (DFP) 形式に量子化され、CPUとGPUの両方で一貫した推論が保証される。
  • 推論時、すべてのレイヤー出力はDFP算術で計算され、その後デノーマライズされて最終的なフィルタリング出力が得られる。
  • パイプライン全体はエンドツーエンドでトレーニング・最適化され、量子化後にファインチューニングを実施することで、性能損失を回復する。
  • 評価は、すべてのイントラおよびランダムアクセス設定下でJEM 7.0を用い、主な指標としてBDレートを用いる。

実験結果

リサーチクエスチョン

  • RQ11つのCNNモデルが、イントラフレーム動画符号化における複数のQP特化型ループフィルタを効果的に置き換えることができるか?
  • RQ2符号化効率を損なわず、モデルの冗長性をどのように低減できるか?
  • RQ3動的固定小数点推論が、異なるハードウェアプラットフォーム間で一貫した結果を保証できるか?
  • RQ4QPに依存しないCNNループフィルタは、JEM 7.0の従来のフィルターよりもどれほど性能向上を達成できるか?
  • RQ5提案手法は、計算およびストレージのオーバーヘッドを低減しつつ、高いパフォーマンスを維持できるか?

主な発見

  • 提案されたCNNFは、すべてのイントラ設定下で、ラマ成分で3.14%のBDレート削減、2つのクロマ成分でそれぞれ5.21%および6.28%の削減を達成し、最良のQP特化型モデルを上回った。
  • 1つのトレーニング済みネットワークで、全テストQPレベル(22–37)において一貫したパフォーマンスを発揮し、複数のQP特化型モデルの必要性が排除された。
  • GPUアクセラレーションを用いることで、エンコード時間はJEM 7.0の93%にまで短縮され、デコード時間も157%のベースラインで管理可能であり、実用的であることが示された。
  • CPU上ではデコード時間が顕著に増加(ClassEでは最大15,360%)するが、これは将来のハードウェアアクセラレーションで改善が見込まれる。
  • フィルタープルーニングと低ランク近似の組み合わせにより、モデルの冗長性が低減され、効率的なデプロイメントが可能になった。
  • 主観的品質向上は特にエッジ領域で顕著に観察され、視覚的忠実度の向上が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。