Skip to main content
QUICK REVIEW

[论文解读] One-to-Many Network for Visually Pleasing Compression Artifacts Reduction

Jun Guo, Hongyang Chao|arXiv (Cornell University)|Nov 15, 2016
Advanced Image Processing Techniques参考文献 37被引用 6
一句话总结

本文提出一种用于JPEG压缩伪影消除的一对多深度学习网络,通过感知损失、自然性损失和JPEG特定损失,为单个输入生成多个视觉上令人愉悦、高质量的重建结果,避免过度平滑。该方法在视觉质量上优于最先进方法,尽管PSNR较低,但通过移位与平均反卷积策略,显著提升了纹理恢复能力并减少了伪影。

ABSTRACT

We consider the compression artifacts reduction problem, where a compressed image is transformed into an artifact-free image. Recent approaches for this problem typically train a one-to-one mapping using a per-pixel $L_2$ loss between the outputs and the ground-truths. We point out that these approaches used to produce overly smooth results, and PSNR doesn't reflect their real performance. In this paper, we propose a one-to-many network, which measures output quality using a perceptual loss, a naturalness loss, and a JPEG loss. We also avoid grid-like artifacts during deconvolution using a "shift-and-average" strategy. Extensive experimental results demonstrate the dramatic visual improvement of our approach over the state of the arts.

研究动机与目标

  • 解决现有一对一深度学习模型因L2损失优化而导致输出过度平滑、纹理丢失的局限性。
  • 通过学习一对多映射,模拟JPEG量化过程的多对一特性,生成多个感知上更优的无伪影候选重建结果。
  • 通过引入感知损失、自然性损失和JPEG特定损失,提升视觉质量,超越PSNR指标,更好地反映人类视觉偏好。
  • 通过移位与平均策略,抑制基于反卷积重建中的网格状伪影。
  • 证明即使PSNR低于基线或压缩输入,感知质量仍可显著提升。

提出的方法

  • 提出一种一对多网络架构,从单个压缩图像输入生成多个无伪影的重建结果。
  • 基于预训练的VGG网络特征,使用感知损失以保留高层语义结构。
  • 引入基于学习分类器的自然性损失,以促进真实图像统计特性和细节。
  • 结合JPEG损失,以保持与原始JPEG编码过程一致的对比度和亮度。
  • 在反卷积过程中应用“移位与平均”策略,以抑制转置卷积引起的网格状伪影。
  • 使用包含感知损失、自然性损失和JPEG损失的多分量损失函数进行网络优化,以平衡保真度与视觉吸引力。

实验结果

研究问题

  • RQ1与一对一映射相比,一对多深度学习框架能否在JPEG压缩伪影消除中提升视觉质量?
  • RQ2用感知损失和自然性损失替代L2损失,是否能生成更真实、更具纹理的重建结果?
  • RQ3感知损失、自然性损失与JPEG特定损失的组合,是否比PSNR更能反映人类视觉偏好?
  • RQ4移位与平均策略在抑制反卷积引起的网格状伪影方面效果如何?
  • RQ5为何在所提方法中PSNR值下降,但视觉质量却提升?

主要发现

  • 所提一对多网络在视觉上显著优于最先进方法,纹理更丰富、边缘更锐利,与ARCNN和DDCN的对比显示尤为明显。
  • 尽管PSNR值较低——例如在Set14上为21.50和21.53,在BSDS500上为24.99和25.32——但重建结果的视觉质量远超PSNR所暗示的水平。
  • 移位与平均策略有效抑制了反卷积中的网格状伪影,提升了视觉质量,且未损害感知性能。
  • 感知损失、自然性损失与JPEG损失的组合,使重建结果在对比度和细节方面得到增强,尤其在高频频段(如毛发和岩石区域)表现突出。
  • 结果表明,网络学习到了语义感知的重建能力,在显著区域(如毛发、灌木)增强纹理,同时保持背景(如天空)的清晰。
  • 该方法可泛化至彩色图像,在RGB数据集(如BSDS500)上的表现优于DDCN和基线模型。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。