[论文解读] Instance-Adaptive Video Compression: Improving Neural Codecs by Training on the Test Set
本文提出实例自适应(InstA)视频压缩,其中在编码时对每个测试视频序列微调预训练神经编解码器。微调后的模型参数通过熵编码传输,与潜在表示一同发送,实现相比基线模型最高27%的BD-rate节省,相比H.265节省44%,同时将解码器复杂度降低70%,且使用更小的模型。
We introduce a video compression algorithm based on instance-adaptive learning. On each video sequence to be transmitted, we finetune a pretrained compression model. The optimal parameters are transmitted to the receiver along with the latent code. By entropy-coding the parameter updates under a suitable mixture model prior, we ensure that the network parameters can be encoded efficiently. This instance-adaptive compression algorithm is agnostic about the choice of base model and has the potential to improve any neural video codec. On UVG, HEVC, and Xiph datasets, our codec improves the performance of a scale-space flow model by between 21% and 27% BD-rate savings, and that of a state-of-the-art B-frame model by 17 to 20% BD-rate savings. We also demonstrate that instance-adaptive finetuning improves the robustness to domain shift. Finally, our approach reduces the capacity requirements of compression models. We show that it enables a competitive performance even after reducing the network size by 70%.
研究动机与目标
- 通过放松泛化要求,缓解在分布偏移和有限训练数据下神经视频编解码器的性能差距。
- 在不修改其架构或训练分布的前提下,提升神经编解码器的率失真性能。
- 通过启用更小、实例优化的模型,降低解码端的计算复杂度。
- 在编码器计算量与压缩效率之间建立权衡,类似于经典编解码器中通过增加编码时间实现的权衡。
- 在包括UVG、HEVC和Xiph-5N在内的多样化视频数据集上,展示鲁棒性与效率的提升。
提出的方法
- 在测试时,使用实例自适应学习方法对每个独立视频序列微调预训练的神经视频编解码器。
- 通过在学习到的混合模型先验下使用熵编码来压缩并传输更新后的模型参数,以最小化比特成本。
- 采用变分自编码器框架,包含独立的编码器、先验和解码器网络,其中编码器和先验网络按视频实例进行更新。
- 通过仅传输来自基线模型的参数增量更新,而非完整权重,来分摊参数传输的成本。
- 将该方法应用于P帧(尺度空间流)和B帧(最先进)架构,以证明其通用性。
- 优化参数更新的熵模型,确保即使仅微调少数几步,也能保持低开销。
实验结果
研究问题
- RQ1与固定全局模型相比,实例自适应微调是否能显著提升神经视频编解码器的率失真性能?
- RQ2实例自适应学习是否能增强对领域偏移的鲁棒性,例如在自然视频与动画视频内容之间的差异?
- RQ3在使用实例自适应的情况下,神经编解码器的模型尺寸可被缩减到何种程度,同时仍保持具有竞争力的性能?
- RQ4在真实世界视频压缩中,编码器计算量与压缩效率之间的权衡效果如何?
- RQ5传输微调后参数的开销是否足够低,能够被整个视频序列的传输过程所分摊?
主要发现
- 在UVG-1k、HEVC类B和Xiph-5N数据集上,InstA相比基线尺度空间流模型实现了21%至27%的BD-rate节省。
- 对于最先进的B帧模型,InstA相比基线模型实现了17%至20%的BD-rate节省。
- 在相同数据集上,InstA相比ffmpeg(x265)的H.265实现,实现了5%至44%的BD-rate节省。
- 该方法提升了对领域偏移的鲁棒性,当使用在自然视频上训练的模型压缩动画序列时,性能显著提升。
- 即使将网络尺寸减少70%,InstA仍保持具有竞争力的性能,表明对表达能力的需求降低。
- 使用更小的模型,解码器端的计算成本降低了70%,且在Tesla V100 GPU上,初始参数解码延迟低于0.2秒。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。