Skip to main content
QUICK REVIEW

[论文解读] Unsupervised Domain-Specific Deblurring via Disentangled Representations

Boyu Lu, Jun-Cheng Chen|arXiv (Cornell University)|Mar 5, 2019
Advanced Image Processing Techniques参考文献 42被引用 15
一句话总结

该论文提出了一种使用解耦表示的无监督领域特定去模糊方法,以在模糊图像中分离内容特征与模糊特征。通过在模糊特征上施加KL散度损失,并结合循环一致性损失与对抗性损失,该模型在无配对训练数据的情况下,在人脸和文本去模糊任务上实现了最先进性能,显著提升了视觉质量与语义恢复效果,优于以往的无监督方法。

ABSTRACT

Image deblurring aims to restore the latent sharp images from the corresponding blurred ones. In this paper, we present an unsupervised method for domain-specific single-image deblurring based on disentangled representations. The disentanglement is achieved by splitting the content and blur features in a blurred image using content encoders and blur encoders. We enforce a KL divergence loss to regularize the distribution range of extracted blur attributes such that little content information is contained. Meanwhile, to handle the unpaired training data, a blurring branch and the cycle-consistency loss are added to guarantee that the content structures of the deblurred results match the original images. We also add an adversarial loss on deblurred results to generate visually realistic images and a perceptual loss to further mitigate the artifacts. We perform extensive experiments on the tasks of face and text deblurring using both synthetic datasets and real images, and achieve improved results compared to recent state-of-the-art deblurring methods.

研究动机与目标

  • 解决无监督、领域特定图像去模糊的挑战,其中缺乏配对训练数据。
  • 提升在人脸和文本等专用领域中的去模糊性能,这些领域因通用去模糊先验而处理效果不佳。
  • 将模糊属性与内容特征解耦,以确保模糊建模的准确性,避免内容信息泄露。
  • 通过循环一致性与感知正则化,保留结构化内容并生成真实、无伪影的去模糊图像。
  • 在下游任务(如人脸验证与OCR)上评估方法,以验证语义信息的恢复程度。

提出的方法

  • 该框架为模糊图像和清晰图像分别使用独立的内容编码器,并共享最后一层权重,将特征投影到同一特征空间。
  • 模糊编码器从模糊图像中提取模糊属性,通过施加KL散度损失来约束其分布,抑制内容信息。
  • 去模糊生成器基于内容特征与模糊特征重建清晰图像,而模糊生成器则从清晰图像中重建模糊图像。
  • 在两个域之间对原始图像与重建图像应用循环一致性损失,以保留内容结构。
  • 在去模糊与模糊结果上使用对抗性损失以增强真实感,同时应用感知损失以减少伪影。
  • 模型使用来自两个域的无配对数据,以端到端方式无监督训练。

实验结果

研究问题

  • RQ1解耦表示学习是否能在无配对训练数据的情况下提升无监督领域特定去模糊性能?
  • RQ2KL散度正则化在确保模糊特征不编码内容信息方面有多有效?
  • RQ3循环一致性损失与对抗性损失是否能协同作用,以在去模糊输出中同时保留内容结构并增强真实感?
  • RQ4与最先进无监督及有监督方法相比,该方法在真实世界人脸与文本去模糊任务上的表现如何?
  • RQ5去模糊输出在多大程度上保留了语义内容,通过人脸验证与OCR准确率进行衡量?

主要发现

  • 所提方法在人脸去模糊任务上表现优异,视觉质量与结构保持方面优于CycleGAN与通用CNN方法。
  • 在BMVC_Text数据集上,尽管为无监督方法,其OCR错误率与最先进有监督方法相当。
  • 模型成功恢复了背景与面部细节的清晰纹理,避免了Deep Semantic Face Deblurring等方法中常见的过度平滑问题。
  • 在真实模糊文本图像上,该方法能正确恢复大部分文本内容,优于CycleGAN与传统方法,后者常引入蓝色伪影或无法恢复可读文本。
  • 消融实验证实,KL损失、循环一致性、对抗性损失与感知损失各组件均对性能有显著贡献。
  • 该方法在真实世界图像上展现出强大的泛化能力,在人脸与文本去模糊任务上均生成视觉上合理的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。