Skip to main content
QUICK REVIEW

[论文解读] Exploiting Raw Images for Real-Scene Super-Resolution

Xiangyu Xu, Yongrui Ma|arXiv (Cornell University)|Feb 2, 2021
Advanced Image Processing Techniques参考文献 73被引用 4
一句话总结

本文提出了一种双分支卷积神经网络,利用原始图像数据和逼真的相机退化模拟,实现了真实场景单图像超分的最先进性能。通过生成模拟真实成像过程(包括可变模糊核和异方差噪声)的训练数据,并利用线性原始数据以增强细节恢复,该方法在未经相机特定微调的情况下,于真实拍摄图像上实现了优异的PSNR(30.27)和SSIM(0.7871)。

ABSTRACT

Super-resolution is a fundamental problem in computer vision which aims to overcome the spatial limitation of camera sensors. While significant progress has been made in single image super-resolution, most algorithms only perform well on synthetic data, which limits their applications in real scenarios. In this paper, we study the problem of real-scene single image super-resolution to bridge the gap between synthetic data and real captured images. We focus on two issues of existing super-resolution algorithms: lack of realistic training data and insufficient utilization of visual information obtained from cameras. To address the first issue, we propose a method to generate more realistic training data by mimicking the imaging process of digital cameras. For the second issue, we develop a two-branch convolutional neural network to exploit the radiance information originally-recorded in raw images. In addition, we propose a dense channel-attention block for better image restoration as well as a learning-based guided filter network for effective color correction. Our model is able to generalize to different cameras without deliberately training on images from specific camera types. Extensive experiments demonstrate that the proposed algorithm can recover fine details and clear structures, and achieve high-quality results for single image super-resolution in real scenes.

研究动机与目标

  • 弥合单图像超分任务中合成训练数据与真实拍摄图像之间的域差距。
  • 解决现有方法忽略原始图像数据中辐射度信息且使用过度简化的数据生成流程的局限性。
  • 开发一种可泛化的超分模型,在无需微调的情况下,对多种相机类型和图像信号处理(ISP)流水线均表现良好。
  • 通过利用高比特深线性原始数据并建模训练期间的真实图像退化,提升图像恢复质量。
  • 通过基于学习的引导滤波器和密集通道注意力模块,实现在真实世界超分中有效的色彩校正与结构保持。

提出的方法

  • 一种数据生成流程,通过在原始线性数据上应用可变模糊核和异方差高斯噪声来模拟真实相机成像,而非在非线性彩色图像上进行。
  • 一种双分支CNN架构:一个分支处理原始数据以恢复高分辨率线性测量值,另一个分支利用处理后的RGB图像优化色彩一致性。
  • 一种密集通道注意力模块,可自适应地重新校准特征图,以增强重要特征并抑制噪声。
  • 一种基于学习的引导滤波网络,实现有效的色彩校正,在保留结构细节的同时纠正色彩偏移。
  • 在重建图像上使用L1损失,并引入感知损失以提升视觉质量,尽管发现基于GAN的损失会引入伪影。
  • 模型在具有逼真退化的合成数据上进行训练,无需微调即可泛化至未见过的相机和ISP。

实验结果

研究问题

  • RQ1逼真的图像退化建模(如可变模糊与异方差噪声)是否能提升超分模型在真实拍摄图像上的泛化能力?
  • RQ2利用原始图像数据(其具有更高的比特深度和线性辐射度信息)是否能带来优于使用处理后RGB图像的超分性能?
  • RQ3双分支网络架构能否有效结合原始数据恢复与色彩校正,从而同时提升结构保真度与色彩准确性?
  • RQ4所提方法在未微调的情况下,对不同相机型号和ISP流水线的泛化能力如何?
  • RQ5对抗性训练对感知质量与伪影生成的影响如何,特别是在真实场景超分任务中?

主要发现

  • 所提方法在真实拍摄图像上实现了30.27的PSNR和0.7871的SSIM,显著优于先前的SOTA方法(如RDN:29.08 PSNR,0.7570 SSIM)。
  • 使用作者提出的逼真数据生成流程对现有RDN模型进行微调,可使性能从PSNR 29.08提升至30.05,证明了该数据生成方法的有效性。
  • 模型在未见过的相机和多样化的ISP流水线(包括HDR处理和人工润饰图像)上均表现出良好的泛化能力,且无需了解原始ISP信息。
  • 使用原始数据与线性退化建模的方法相比使用处理后RGB图像的方法,能生成更锐利的结构与更精细的细节。
  • 尽管采用双分支架构,模型仍保持了具有竞争力的推理速度(每张800×600图像0.647秒),与其它SOTA网络相当。
  • 使用GAN损失的对抗性训练虽使图像更锐利,但导致明显伪影,因此未在最终模型中采用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。