Skip to main content
QUICK REVIEW

[论文解读] Single Underwater Image Restoration by Contrastive Learning

Junlin Han, Mehrdad Shoeiby|arXiv (Cornell University)|Mar 17, 2021
Image Enhancement Techniques参考文献 14被引用 6
一句话总结

本文提出对比水下恢复(CWR),一种新颖的无监督图像到图像翻译方法,利用对比学习与生成对抗网络,最大化原始与恢复后水下图像块之间的互信息,在新的大规模真实水下数据集(HICRD)上实现最先进性能。CWR在保留图像结构和色彩保真度的同时,有效减少了伪影。

ABSTRACT

Underwater image restoration attracts significant attention due to its importance in unveiling the underwater world. This paper elaborates on a novel method that achieves state-of-the-art results for underwater image restoration based on the unsupervised image-to-image translation framework. We design our method by leveraging from contrastive learning and generative adversarial networks to maximize mutual information between raw and restored images. Additionally, we release a large-scale real underwater image dataset to support both paired and unpaired training modules. Extensive experiments with comparisons to recent approaches further demonstrate the superiority of our proposed method.

研究动机与目标

  • 解决因光吸收、散射及波长相关衰减导致水下图像视觉质量低下的挑战。
  • 开发一种鲁棒的无监督图像到图像翻译框架,无需成对训练数据即可恢复真实水下图像。
  • 构建一个大规模、高分辨率的真实水下图像数据集(HICRD),支持成对与非成对训练,以提升模型泛化能力。
  • 最大化原始与恢复图像对应图像块之间的互信息,以保留内容与色彩对应关系。
  • 通过结合对比学习与基于GAN的生成建模,实现水下图像恢复的最先进性能。

提出的方法

  • CWR将水下图像恢复建模为使用基于ResNet的生成器与PatchGAN判别器的图像到图像翻译问题。
  • 该模型采用对比学习框架,结合PatchNCE损失,以最大化原始与恢复图像局部块之间的互信息。
  • 通过两层MLP投影头处理从ResNet编码器提取的特征,以支持对比表示学习。
  • 目标函数结合对抗损失(L_GAN)、PatchNCE对比损失(L_PatchNCE)与身份损失(L_IDT),以确保图像真实性、特征对应性与结构一致性。
  • 总损失定义为:L(G,D,H) = λ_GAN·L_GAN + λ_NCE·L_PatchNCE + λ_IDT·L_IDT,其中 λ_GAN = λ_NCE = λ_IDT = 1。
  • 该方法对判别器使用谱归一化,对生成器使用实例归一化,采用Adam优化器训练,初始学习率线性衰减至0.0002。

实验结果

研究问题

  • RQ1在无成对监督的情况下,对比学习能否有效捕捉原始与恢复水下图像块之间的内容与色彩对应关系?
  • RQ2与现有图像到图像翻译及水下图像恢复模型相比,所提出的CWR方法在保留图像结构与色彩保真度方面表现如何?
  • RQ3大规模真实世界水下图像数据集(HICRD)在多大程度上提升了水下图像恢复模型的性能与泛化能力?
  • RQ4基于对比学习的方法是否在定量与定性指标上均优于传统与学习型水下图像增强方法?
  • RQ5将对比学习与GAN结合是否能带来更真实、无伪影的水下图像恢复效果?

主要发现

  • 在HICRD测试集上,CWR的MSE最低(127.23),PSNR最高(26.88),优于所有对比方法。
  • CWR的SSIM最高(0.834),表明其在保留图像结构方面表现优异。
  • CWR在FID上排名第二(18.20),显示生成图像具有高度真实性;在UIQM上表现优异(5.25),表明与人类视觉感知高度一致。
  • 定性结果表明,CWR生成的图像更清晰、更自然,伪影极少,色彩恢复准确,显著优于传统与学习型基线方法。
  • HICRD数据集包含6,003张低质量、3,673张高质量及2,000张恢复图像,分辨率为1842×980,可支持成对与非成对设置下的稳健评估与训练。
  • CWR在所有全参考与非参考指标上均显著优于最先进方法,包括CUT、CycleGAN、UWCNN、Retinex、Fusion、DCP与IBLA。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。