[论文解读] Learning Frequency-aware Dynamic Network for Efficient Super-Resolution
该论文提出了一种频率感知的动态网络(FADN),通过可学习的DCT-based掩码预测器,自适应地为低频图像区域分配轻量级操作,为高频区域分配更重的运算,从而实现高效的单图像超分辨率。该方法在保持多个基准测试中SOTA性能的同时,将FLOPs减少了约50%。
Deep learning based methods, especially convolutional neural networks (CNNs) have been successfully applied in the field of single image super-resolution (SISR). To obtain better fidelity and visual quality, most of existing networks are of heavy design with massive computation. However, the computation resources of modern mobile devices are limited, which cannot easily support the expensive cost. To this end, this paper explores a novel frequency-aware dynamic network for dividing the input into multiple parts according to its coefficients in the discrete cosine transform (DCT) domain. In practice, the high-frequency part will be processed using expensive operations and the lower-frequency part is assigned with cheap operations to relieve the computation burden. Since pixels or image patches belong to low-frequency areas contain relatively few textural details, this dynamic network will not affect the quality of resulting super-resolution images. In addition, we embed predictors into the proposed dynamic network to end-to-end fine-tune the handcrafted frequency-aware masks. Extensive experiments conducted on benchmark SISR models and datasets show that the frequency-aware dynamic network can be employed for various SISR neural architectures to obtain the better tradeoff between visual quality and computational complexity. For instance, we can reduce the FLOPs of SR models by approximate 50% while preserving state-of-the-art SISR performance.
研究动机与目标
- 为解决深度超分辨率模型在移动设备上的高计算成本问题。
- 减少处理低频和中频图像区域时的计算冗余,这些区域对视觉质量的贡献较小。
- 设计一种基于DCT域分析的动态网络,根据频率内容分配计算量。
- 实现端到端学习频率感知的路由掩码,而无需依赖固定的手工设计阈值。
- 在显著降低FLOPs的同时,保持多种SISR架构下的高图像质量。
提出的方法
- 一种频率感知的动态网络(FADN)使用可学习的掩码预测器,将输入特征按频率划分为多个分支。
- 掩码预测器通过SISR任务的重建损失以及手工制作的DCT-based频率掩码进行端到端训练。
- 低频分量使用轻量级卷积层处理,而高频分量则使用更重的运算。
- 使用DCT域生成初始频率掩码以提供监督,使模型能够学习有意义的频率划分。
- 预测器可根据输入和块动态调整划分阈值,避免使用固定或随机掩码。
- 该框架支持可变的分支数量,并可集成到现有SISR架构中。
实验结果
研究问题
- RQ1能否在不降低超分辨率质量的前提下,有效减少低频和中频图像区域的计算冗余?
- RQ2可学习的掩码预测器能否在特征图的动态路由中超越手工制作的DCT-based频率掩码?
- RQ3基于频率内容的动态计算分配是否能改善SISR模型的FLOPs-质量权衡?
- RQ4所提出的FADN能否在不同SISR架构上通用应用并保持一致的效率提升?
- RQ5掩码预测器数量和分支数量如何影响性能与计算效率?
主要发现
- 所提出的FADN在多个SISR模型上将FLOPs减少了约50%,同时在基准数据集上保持了SOTA性能。
- 在×2缩放下,模型在Set5上的PSNR达到37.90,在Urban100上达到31.85,与原始模型性能相当或更优。
- 可学习的频率掩码优于随机掩码和固定DCT-based掩码,收敛更快且精度更高。
- 在所有块上共享一个掩码预测器的性能低于每个块独立的预测器,证实了自适应、块特定路由的必要性。
- 三分支FADN在性能与存储成本之间提供了最佳平衡,优于2分支和4分支变体。
- 混淆矩阵和可视化结果表明,学习到的掩码与DCT-based分布高度一致,但能自适应地优化边界以获得更高精度。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。