[论文解读] CDFI: Compression-Driven Network Design for Frame Interpolation
CDFI 提出了一种以压缩为导向的视频帧插值框架,该框架首先通过稀疏性诱导优化对预训练的 AdaCoF 模型进行剪枝,实现模型大小缩小 10 倍的同时保持相近性能;随后通过引入多分辨率变形模块提升细节保留与运动处理能力,最终得到的模型仅为原始 AdaCoF 模型大小的 25%,但在 Middlebury 数据集上的 PSNR 性能超越原始模型超过 1 dB,且在准确率与效率方面媲美或超越当前最先进方法。
DNN-based frame interpolation--that generates the intermediate frames given two consecutive frames--typically relies on heavy model architectures with a huge number of features, preventing them from being deployed on systems with limited resources, e.g., mobile devices. We propose a compression-driven network design for frame interpolation (CDFI), that leverages model pruning through sparsity-inducing optimization to significantly reduce the model size while achieving superior performance. Concretely, we first compress the recently proposed AdaCoF model and show that a 10X compressed AdaCoF performs similarly as its original counterpart; then we further improve this compressed model by introducing a multi-resolution warping module, which boosts visual consistencies with multi-level details. As a consequence, we achieve a significant performance gain with only a quarter in size compared with the original AdaCoF. Moreover, our model performs favorably against other state-of-the-arts in a broad range of datasets. Finally, the proposed compression-driven framework is generic and can be easily transferred to other DNN-based frame interpolation algorithm. Our source code is available at https://github.com/tding1/CDFI.
研究动机与目标
- 为解决现有基于深度神经网络(DNN)的帧插值模型效率低下且资源消耗过高的问题,这些模型过大,难以在移动设备或边缘设备上部署。
- 探究超参数化的最先进模型是否包含可被利用的冗余容量,从而在不损失性能的前提下实现模型压缩。
- 开发一种通用且可迁移的框架,将模型压缩作为设计指导,构建更小、更高效的模型并提升性能。
- 通过架构改进(特别是多分辨率变形模块)进一步增强紧凑且压缩后的模型,以更好地处理遮挡与细节。
提出的方法
- 应用稀疏性诱导优化对 AdaCoF 模型进行微调与剪枝,使其大小缩小 10 倍,同时保持相近性能。
- 引入多分辨率变形模块,利用输入帧的特征金字塔提升运动一致性与细节保留能力。
- 设计路径选择机制,融合不同分辨率层级的特征,以有效处理大范围运动与精细细节。
- 将压缩后的模型作为轻量化主干网络,并施加针对性的架构增强,使性能超越原始模型。
- 利用压缩过程中的洞察指导架构重构,从而构建出更高效、更准确的最终模型。
实验结果
研究问题
- RQ1一个显著压缩的最先进帧插值模型(如 AdaCoF)能否维持具有竞争力的性能,从而表明原始架构中存在冗余?
- RQ2模型压缩过程是否能揭示有助于指导更高效、更准确模型设计的架构洞见?
- RQ3一个紧凑且剪枝后的模型能否通过针对性的架构增强(如多分辨率特征融合)进一步提升性能?
- RQ4所提出的压缩驱动设计框架是否可泛化至其他基于 DNN 的帧插值模型?
主要发现
- 10 倍压缩的 AdaCoF 模型性能与原始模型相当,表明原始模型存在显著冗余。
- 基于压缩主干构建的最终 CDFI 模型在 Middlebury 数据集上达到 33.45 的 PSNR,较原始 AdaCoF 提升超过 1 dB,且模型大小仅为原始模型的 25%。
- 在 DAVIS 与 Vimeo-90K 数据集上,CDFI 在 PSNR 与 SSIM 指标上均优于或匹配当前最先进方法,且 FLOPs 与模型大小显著更低。
- 多分辨率变形模块与路径选择机制使模型在处理大范围运动与精细细节方面优于原始 AdaCoF,尤其在遮挡区域与纹理丰富的区域表现更优。
- 所提出的框架具有通用性,可迁移至其他基于 DNN 的帧插值模型,如在 AdaCoF 上的成功应用所示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。