Skip to main content
QUICK REVIEW

[论文解读] Collapsible Linear Blocks for Super-Efficient Super Resolution

Kartikeya Bhardwaj, Miloš Milosavljević|arXiv (Cornell University)|Mar 17, 2021
Advanced Image Processing Techniques参考文献 38被引用 10
一句话总结

本文提出Super-Efficient Super Resolution (SESR),一种新颖的CNN架构,采用可折叠线性模块,实现显著的计算效率提升,同时不损失图像质量。通过在推理时将过参数化的线性层解析折叠为单个卷积层,SESR在MAC操作次数上比以往模型减少2倍至330倍,实现了在移动NPU上实时进行×2(1080p至4K)和×4(1080p至8K)超分辨率,帧率比现有方法最高提升8倍。

ABSTRACT

With the advent of smart devices that support 4K and 8K resolution, Single Image Super Resolution (SISR) has become an important computer vision problem. However, most super resolution deep networks are computationally very expensive. In this paper, we propose Super-Efficient Super Resolution (SESR) networks that establish a new state-of-the-art for efficient super resolution. Our approach is based on linear overparameterization of CNNs and creates an efficient model architecture for SISR. With theoretical analysis, we uncover the limitations of existing overparameterization methods and show how the proposed method alleviates them. Detailed experiments across six benchmark datasets demonstrate that SESR achieves similar or better image quality than state-of-the-art models while requiring 2x to 330x fewer Multiply-Accumulate (MAC) operations. As a result, SESR can be used on constrained hardware to perform x2 (1080p to 4K) and x4 (1080p to 8K) SISR. Towards this, we estimate hardware performance numbers for a commercial Arm mobile-Neural Processing Unit (NPU) for 1080p to 4K (x2) and 1080p to 8K (x4) SISR. Our results highlight the challenges faced by super resolution on AI accelerators and demonstrate that SESR is significantly faster (e.g., 6x-8x higher FPS) than existing models on mobile-NPU. Finally, SESR outperforms prior models by 1.5x-2x in latency on Arm CPU and GPU when deployed on a real mobile device. The code for this work is available at https://github.com/ARM-software/sesr.

研究动机与目标

  • 解决现有用于资源受限移动设备上单图像超分辨率(SISR)的深度CNN计算效率低下的问题。
  • 在图像质量(PSNR)与计算成本(MAC操作)之间建立新的帕累托前沿。
  • 通过设计兼具高精度与高效率的模型,实现在移动NPU上实时进行×2和×4 SISR。
  • 克服现有线性过参数化方法(如RepVGG)的理论局限,这些方法在浅层网络中无法带来梯度更新优势。
  • 通过端到端部署和开源性能估算,展示在真实移动硬件(CPU、GPU和NPU)上的实际性能提升。

提出的方法

  • 提出可折叠线性模块——线性卷积层序列,可在推理时被解析合并为单个窄卷积层,从而在不改变架构的前提下减少MAC操作。
  • 采用线性过参数化以提升训练稳定性和泛化能力,同时实现在训练后对参数进行精确压缩。
  • 理论上分析现有过参数化技术,表明如RepVGG等方法在浅层网络中无法改变梯度更新,因而其优势受限。
  • 采用改进的训练协议:在训练时保持过参数化模块结构,但在推理时将其折叠为单层,从而在保持模型精度的同时降低推理成本。
  • 应用神经架构搜索(NAS)进一步优化卷积核形状(如偶数尺寸和非对称核),以提升NPU性能。
  • 使用开源NPU性能估算工具(如Vela)预测并验证在Arm Ethos-U55和Ethos-N78 NPU上的推理性能。

实验结果

研究问题

  • RQ1能否利用线性过参数化构建适用于移动部署的SISR模型,使其兼具高精度与高效率?
  • RQ2现有过参数化技术(如RepVGG)在浅层网络中是否真正带来训练优势,还是其无法改变梯度动态?
  • RQ3可折叠线性模块能否在多个基准测试中实现SISR在质量-计算权衡上的新帕累托前沿?
  • RQ4在真实移动硬件(CPU、GPU、NPU)上,SESR相较于以往模型在延迟和FPS方面表现如何?
  • RQ5通过NAS引导的核优化能否在不牺牲精度的前提下进一步提升移动NPU上的推理速度?

主要发现

  • SESR在六大数据集基准上,相比最先进SISR模型,MAC操作减少2倍至330倍,同时保持或提升PSNR。
  • 在4-TOP/s的Arm Ethos-N78移动NPU上,SESR在1080p至4K(×2)SISR任务中帧率比以往模型高出6倍至8倍,部分变体超过60 FPS。
  • 在1080p至8K(×4)SISR任务中,SESR在相同NPU上最高实现22 FPS,显著优于FSRCNN的6 FPS。
  • 在真实移动硬件(Arm Cortex-A77 CPU和Mali-G78 GPU)上,SESR-M5在×2和×4 SISR任务中相比FSRCNN延迟降低1.5倍至2倍。
  • 采用更小、偶数尺寸和非对称核的NAS优化SESR网络,相比SESR-M5将推理时间减少15%,同时在NPU上保持相同精度。
  • 使用Vela进行开源NPU性能估算,确认SESR-M5在Arm Ethos-U55(0.5 TOP/s)上实现22.67 FPS,相比FSRCNN的2.71 FPS提升8.4倍。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。