[论文解读] OpenDVC: An Open Source Implementation of the DVC Video Compression Method
OpenDVC 提供了一种基于 TensorFlow 的开源实现,采用 Deep Video Compression (DVC) 方法,包含 PSNR 优化和 MS-SSIM 优化的模型。它在原始 DVC 的基础上进行了改进,支持 MS-SSIM 优化的基线模型,并通过使用因子化熵模型降低了分辨率限制,实现了与 x265 相当的性能,且在 MS-SSIM 指标上表现更优。
We introduce an open source Tensorflow implementation of the Deep Video Compression (DVC) method in this technical report. DVC is the first end-to-end optimized learned video compression method, achieving better MS-SSIM performance than the Low-Delay P (LDP) very fast setting of x265 and comparable PSNR performance with x265 (LDP very fast). At the time of writing this report, several learned video compression methods are superior to DVC, but currently none of them provides open source codes. We hope that our OpenDVC codes are able to provide a useful model for further development, and facilitate future researches on learned video compression. Different from the original DVC, which is only optimized for PSNR, we release not only the PSNR-optimized re-implementation, denoted by OpenDVC (PSNR), but also the MS-SSIM-optimized model OpenDVC (MS-SSIM). Our OpenDVC (MS-SSIM) model provides a more convincing baseline for MS-SSIM optimized methods, which can only compare with the PSNR optimized DVC in the past. The OpenDVC source codes and pre-trained models are publicly released at https://github.com/RenYang-home/OpenDVC.
研究动机与目标
- 提供一种开源、可复现的 DVC 视频压缩方法实现,以支持学习型视频压缩领域的进一步研究。
- 解决当前最先进的学习型视频压缩方法缺乏公开代码的问题,此前这限制了对比性研究的开展。
- 发布 PSNR 优化和 MS-SSIM 优化的模型,使针对 MS-SSIM 的方法能够实现更公平的基准测试。
- 通过用因子化熵模型替代超先验熵模型,降低输入分辨率的限制,将原本必须为 32 的倍数的分辨率要求降低为 16 的倍数,从而提升对低分辨率输入的兼容性。
- 通过提供文档齐全、可重用的代码库及预训练模型,促进未来开发。
提出的方法
- 采用 DVC 框架,使用金字塔网络进行连续帧之间的运动估计,采用五层架构和 7×7 卷积核。
- 使用带有 GDN 和反向 GDN 激活函数的可学习自编码器来压缩运动向量,每层使用 3×3 卷积和 128 个滤波器。
- 将原始的超先验熵模型替换为因子化熵模型,将输入分辨率的限制从必须为 32 的倍数降低为 16 的倍数。
- 使用带有 3×3 卷积和跳跃连接的运动补偿网络,生成运动补偿的参考帧。
- 对残差压缩采用类似的自编码器,使用 5×5 卷积核,以增强高比特率残差数据的表示能力。
- 采用渐进式训练流程:首先进行运动估计,然后是运动压缩,接着是运动补偿,最后进行端到端联合训练,损失函数为加权率失真损失。
实验结果
研究问题
- RQ1开源的 DVC 实现是否能促进学习型视频压缩研究的可及性和可复现性?
- RQ2将超先验熵模型替换为因子化模型,对压缩性能和输入分辨率灵活性有何影响?
- RQ3MS-SSIM 优化的 DVC 变体是否能在感知质量指标上显著优于原始的 PSNR 优化 DVC?
- RQ4OpenDVC 实现的性能在 PSNR 和 MS-SSIM 指标上与 x265 等标准编码器相比如何?是否达到或超越其性能?
- RQ5渐进式训练策略是否能有效优化端到端的视频压缩流程?
主要发现
- OpenDVC (PSNR) 在 PSNR 和 MS-SSIM 性能上与原始 DVC 相当,并与 x265 (LDP very fast) 设置的性能匹配。
- OpenDVC (MS-SSIM) 在 MS-SSIM 指标上显著优于原始 DVC,为感知优化型视频压缩方法提供了更相关的基线。
- 因子化熵模型将输入分辨率限制从 32 的倍数降低为 16 的倍数,提升了可用性,且性能损失可忽略。
- MS-SSIM 优化模型通过使用 1 - MS-SSIM 作为失真损失,从预训练的 PSNR 模型进行微调,实现了更优的感知质量。
- 后续提出的 RLVC 方法在率失真性能上优于 DVC 和 OpenDVC,进一步推进了学习型视频压缩的最先进水平。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。