[论文解读] Achieving on-Mobile Real-Time Super-Resolution with Neural Architecture and Pruning Search
该论文提出了一种联合神经架构与剪枝搜索框架,可自动生成轻量化、稀疏的超分辨率模型,在三星Galaxy S20等移动设备上实现每帧低于50ms的实时推理,同时保持具有竞争力的PSNR和SSIM指标。通过使用参数共享的超网络,并将搜索过程解耦为三个阶段——超网络构建、编译器感知的架构与剪枝搜索,以及基于贝叶斯优化的剪枝率优化,该方法实现了高效、端到端的最优SR模块与逐层剪枝配置搜索,最终在移动平台上首次实现720p的实时超分辨率。
Though recent years have witnessed remarkable progress in single image super-resolution (SISR) tasks with the prosperous development of deep neural networks (DNNs), the deep learning methods are confronted with the computation and memory consumption issues in practice, especially for resource-limited platforms such as mobile devices. To overcome the challenge and facilitate the real-time deployment of SISR tasks on mobile, we combine neural architecture search with pruning search and propose an automatic search framework that derives sparse super-resolution (SR) models with high image quality while satisfying the real-time inference requirement. To decrease the search cost, we leverage the weight sharing strategy by introducing a supernet and decouple the search problem into three stages, including supernet construction, compiler-aware architecture and pruning search, and compiler-aware pruning ratio search. With the proposed framework, we are the first to achieve real-time SR inference (with only tens of milliseconds per frame) for implementing 720p resolution with competitive image quality (in terms of PSNR and SSIM) on mobile platforms (Samsung Galaxy S20).
研究动机与目标
- 为解决在资源受限的移动设备上部署实时、高质量单图像超分辨率(SISR)的挑战。
- 克服深度学习-based SISR模型在移动环境中计算与内存开销过高的问题。
- 联合优化每一层的神经架构与剪枝配置,以平衡推理速度与图像质量。
- 通过使用共享的超网络与解耦的搜索阶段,降低模型搜索中的搜索成本与训练开销。
- 在移动平台上实现720p视频超分辨率的实时性能(≥20 FPS),同时保持具有竞争力的感知质量与度量指标。
提出的方法
- 该方法引入一个具有参数共享的超网络,以实现无需为每组组合重新训练即可高效搜索多种SR模块与剪枝配置。
- 将搜索过程解耦为三个阶段:超网络构建、编译器感知的架构与剪枝搜索,以及编译器感知的剪枝率搜索。
- 使用贝叶斯优化(BO)加速最优SR模块与剪枝方案的搜索,减少所需评估次数。
- 该框架执行编译器感知搜索,以确保最终剪枝后的模型与硬件加速兼容,并实现低延迟推理。
- 搜索过程受目标延迟约束(如×2和×3为50ms,×4为40ms)引导,以确保在移动设备上实现实时性能。
- 最终模型在移动硬件(三星Galaxy S20)上使用MNN和PyTorch Mobile等优化推理框架进行评估。

实验结果
研究问题
- RQ1联合神经架构与剪枝配置的搜索框架能否在移动设备上实现实时超分辨率?
- RQ2基于超网络的参数共享与解耦搜索如何降低SISR模型搜索中的训练与搜索开销?
- RQ3与在整个模型上应用固定剪枝相比,逐层自适应剪枝方案有何影响?
- RQ4在严格的延迟约束下,贝叶斯优化能否有效加速最优SR模块与剪枝率的搜索?
- RQ5在实时移动SISR中,推理速度、模型大小与图像质量(PSNR/SSIM)之间的可实现权衡是什么?
主要发现
- 所提方法在三星Galaxy S20上实现了实时超分辨率,×2和×3缩放的每帧推理延迟低于50ms,×4缩放低于40ms。
- 在×2缩放、目标延迟50ms的情况下,模型在Set5数据集上达到31.93 PSNR与0.8906 SSIM,优于CARN-M与FALSR-C在准确率与MACs方面的表现。
- 在40ms目标延迟下,模型在Set5上达到30.74 PSNR与0.8671 SSIM,尽管模型压缩程度极高(12 MACs,0.7M参数),仍展现出具有竞争力的图像质量。
- 在×4缩放任务中,延迟120ms的模型在PSNR与SSIM上优于SRCNN、FSRCNN与FEQE-P,同时使用更少的MACs。
- 通过编译器优化,该方法在×2和×3上实现超过20 FPS,在×4上实现超过25 FPS,优于MNN与PyTorch Mobile。
- 消融实验表明,架构搜索与剪枝搜索均不可或缺:架构搜索提升质量,剪枝搜索实现速度,二者结合可获得最优结果。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。