[论文解读] Explainable Machine Learning based Transform Coding for High Efficiency Intra Prediction
该论文提出了一种基于可解释机器学习的变换编码框架,采用子空间近似修正偏差(Saab)变换实现高效帧内视频编码。通过将变换设计建模为能量压缩优化问题,并将Saab变换与率失真优化(RDO)相结合,该方法在传统基于DCT的编码基础上实现了最高达10.00%的比特率降低,所有测试序列的平均BD-率增益为-3.07%。
Machine learning techniques provide a chance to explore the coding performance potential of transform. In this work, we propose an explainable transform based intra video coding to improve the coding efficiency. Firstly, we model machine learning based transform design as an optimization problem of maximizing the energy compaction or decorrelation capability. The explainable machine learning based transform, i.e., Subspace Approximation with Adjusted Bias (Saab) transform, is analyzed and compared with the mainstream Discrete Cosine Transform (DCT) on their energy compaction and decorrelation capabilities. Secondly, we propose a Saab transform based intra video coding framework with off-line Saab transform learning. Meanwhile, intra mode dependent Saab transform is developed. Then, Rate Distortion (RD) gain of Saab transform based intra video coding is theoretically and experimentally analyzed in detail. Finally, three strategies on integrating the Saab transform and DCT in intra video coding are developed to improve the coding efficiency. Experimental results demonstrate that the proposed 8$ imes$8 Saab transform based intra video coding can achieve Bjønteggard Delta Bit Rate (BDBR) from -1.19% to -10.00% and -3.07% on average as compared with the mainstream 8$ imes$8 DCT based coding scheme.
研究动机与目标
- 通过用数据驱动的、可解释的机器学习基变换替代DCT等固定变换,提升视频编码效率。
- 解决传统变换在捕捉不同帧内预测模式下视频残差多样统计特性方面的局限性。
- 开发一种实用且可解释的变换框架,在保持低计算与内存开销的同时实现显著的率失真增益。
- 通过理论与实验评估,分析并量化Saab变换相较于DCT的性能表现。
- 设计Saab与DCT变换在帧内编码框架中有效结合的集成策略,以实现最优率失真性能。
提出的方法
- 将基于机器学习的变换设计建模为优化问题,以最大化能量压缩与去相关性,采用子空间近似修正偏差(Saab)变换作为核心方法。
- 开发离线Saab变换学习框架,其中变换核从训练数据中预先学习并存储,供编码阶段使用。
- 引入帧内模式相关的Saab变换,根据帧内预测模式选择不同的变换核,以更好地匹配残差特性。
- 采用率失真优化(RDO)选择每个块的DCT或Saab变换,以最小化率失真成本。
- 提出三种集成策略(sI、sII、sIII),用于结合Saab与DCT变换,其中sIII采用基于模式的Saab选择与RDO决策机制。
- 使用不同精度(2–5位小数)的浮点数运算,评估Saab变换性能对量化精度的鲁棒性。
实验结果
研究问题
- RQ1像Saab这样的可解释机器学习基变换是否能在视频残差编码中实现优于标准DCT的能量压缩与去相关性?
- RQ2Saab变换在不同帧内预测模式与视频内容类型下的性能表现如何?
- RQ3在帧内编码中,如何实现Saab与DCT变换的最佳集成策略以最大化率失真增益?
- RQ4Saab变换性能对变换计算中浮点数表示精度的敏感程度如何?
- RQ5相较于单一全局变换,使用模式相关的Saab变换在多大程度上提升了编码效率?
主要发现
- 所提出的8×8 Saab变换相较于基于DCT的编码,实现了-1.19%至-10.00%的Bjønset率增益(BDBR),所有测试序列的平均改善为-3.07%。
- 在'BasketballDrillText'和'RaceHorses'等序列中,超过80%的8×8块在QP=37时选择Saab变换作为最优方案,表明其对残差特性的强适应能力。
- 所有QP值下,使用Saab变换的块占比平均为46.05%,在'BasketballDrillText'序列中QP=37时最高达到90.34%。
- 将浮点数精度从3位减少到5位小数对比特率节省影响可忽略,表明对精度降低具有强鲁棒性。
- 集成策略sIII(采用模式相关的Saab变换与RDO决策)实现了最佳整体率失真性能,优于DCT和单一变换的Saab方案。
- 与DCT相比,Saab变换在方向性或复杂纹理区域表现出更优的能量压缩与去相关能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。