Skip to main content
QUICK REVIEW

[論文レビュー] Explainable Machine Learning based Transform Coding for High Efficiency Intra Prediction

Na Li, Yun Zhang|arXiv (Cornell University)|Dec 21, 2020
Video Coding and Compression Technologies参考文献 30被引用数 6
ひとこと要約

本稿では、高効率な内因的動画符号化のため、サブスペース近似と補正バイアス(Saab)変換を用いた解釈可能な機械学習ベースの変換符号化フレームワークを提案する。変換設計をエネルギー集約最適化問題として定式化し、Saab変換と率歪み最適化(RDO)を統合することで、従来のDCTベースの符号化と比較して最大10.00%のビットレート低減を達成し、テストシーケンス全体で平均-3.07%のBDBR向上を実現した。

ABSTRACT

Machine learning techniques provide a chance to explore the coding performance potential of transform. In this work, we propose an explainable transform based intra video coding to improve the coding efficiency. Firstly, we model machine learning based transform design as an optimization problem of maximizing the energy compaction or decorrelation capability. The explainable machine learning based transform, i.e., Subspace Approximation with Adjusted Bias (Saab) transform, is analyzed and compared with the mainstream Discrete Cosine Transform (DCT) on their energy compaction and decorrelation capabilities. Secondly, we propose a Saab transform based intra video coding framework with off-line Saab transform learning. Meanwhile, intra mode dependent Saab transform is developed. Then, Rate Distortion (RD) gain of Saab transform based intra video coding is theoretically and experimentally analyzed in detail. Finally, three strategies on integrating the Saab transform and DCT in intra video coding are developed to improve the coding efficiency. Experimental results demonstrate that the proposed 8$ imes$8 Saab transform based intra video coding can achieve Bjønteggard Delta Bit Rate (BDBR) from -1.19% to -10.00% and -3.07% on average as compared with the mainstream 8$ imes$8 DCT based coding scheme.

研究の動機と目的

  • 固定変換(DCTなど)をデータ駆動型で解釈可能な機械学習ベースの変換に置き換えることで、動画符号化効率を向上させること。
  • 異なる内因的予測モードにおける動画残差の多様な統計的特徴を捉えることが難しい従来の変換の限界を解消すること。
  • 計算およびメモリオーバーヘッドを低く保ちつつ、顕著な率歪み利得を実現できる実用的で解釈可能な変換フレームワークを開発すること。
  • 理論的および実験的評価を通じて、Saab変換とDCTとの性能を分析・定量すること。
  • 最適なRD性能を達成するため、内因的符号化フレームワーク内でSaab変換とDCT変換を効果的に統合する戦略を設計すること。

提案手法

  • 機械学習ベースの変換設計を、エネルギー集約と相関除去を最大化する最適化問題として定式化し、コア手法としてサブスペース近似と補正バイアス(Saab)変換を用いる。
  • 変換カーネルをトレーニングデータから事前に学習し、エンコード時に使用するためのオフラインSaab変換学習フレームワークを構築する。
  • 内因的予測モードに応じたSaab変換を導入し、残差特性に適応するため、各モードに応じて異なる変換カーネルを選択する。
  • 各ブロックに対してDCTとSaab変換の間で率歪み最適化(RDO)を用いて最適な選択を行い、RDコストを最小化する。
  • Saab変換とDCT変換を統合するための3つの戦略(sI, sII, sIII)を提案し、sIIIはモード依存のSaab選択とRDOに基づく意思決定を採用する。
  • 変換計算における浮動小数点表現の精度(2〜5桁)を変化させることで、Saab変換の性能が量子化にどれほど影響を受けるかを評価する。

実験結果

リサーチクエスチョン

  • RQ1解釈可能な機械学習ベースの変換(例:Saab)は、動画残差符号化においてエネルギー集約および相関除去の観点で標準的なDCTを上回ることができるか?
  • RQ2Saab変換の性能は、異なる内因的予測モードや動画コンテンツタイプによってどのように変化するか?
  • RQ3内因的符号化において、RD利得を最大化するためのSaab変換とDCT変換の最適統合戦略は何か?
  • RQ4Saab変換の性能は、変換計算における浮動小数点表現の精度にどれほど敏感か?
  • RQ5モード依存のSaab変換を用いることで、単一のグローバル変換と比較して符号化効率がどの程度向上するか?

主な発見

  • 提案された8×8 Saab変換は、DCTベースの符号化と比較して、Bjønsetデルタビットレート(BDBR)で-1.19%〜-10.00%の向上を達成し、テストシーケンス全体で平均-3.07%の改善を示した。
  • 『BasketballDrillText』や『RaceHorses』などのシーケンスでは、QP=37における8×8ブロックの80%以上がDCTよりもSaab変換を選択しており、残差特性への強い適応性を示した。
  • 全QP範囲で平均46.05%のブロックがSaab変換を使用しており、QP=37の『BasketballDrillText』では最高で90.34%の使用率を記録した。
  • 浮動小数点精度を3桁から5桁に低下させても、ビットレート削減効果に顕著な影響がなく、精度低下に対しても頑健であることが示された。
  • モード依存のSaab変換とRDOを組み合わせた統合戦略sIIIが、DCTおよび単一変換のSaab方式を上回る最良の全体的なRD性能を達成した。
  • 特に方向性や複雑なテクスチャを有する領域では、Saab変換がDCTに比べて優れたエネルギー集約および相関除去能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。