Skip to main content
QUICK REVIEW

[论文解读] Simultaneous Enhancement and Super-Resolution of Underwater Imagery for Improved Visual Perception

Md Jahidul Islam, Peigen Luo|arXiv (Cornell University)|Feb 4, 2020
Image Enhancement Techniques被引用 10
一句话总结

本文提出 Deep SESR,一种统一的深度学习框架,通过残差嵌套网络同时实现水下图像质量增强与最高4倍分辨率的超分辨率。该框架通过多模态损失函数联合学习感知增强、超分辨率与显著性预测,实现在水下和陆地图像上的最先进性能,并可在 NVIDIA AGX Xavier 等单板计算平台实现实时推理。

ABSTRACT

In this paper, we introduce and tackle the simultaneous enhancement and super-resolution (SESR) problem for underwater robot vision and provide an efficient solution for near real-time applications. We present Deep SESR, a residual-in-residual network-based generative model that can learn to restore perceptual image qualities at 2x, 3x, or 4x higher spatial resolution. We supervise its training by formulating a multi-modal objective function that addresses the chrominance-specific underwater color degradation, lack of image sharpness, and loss in high-level feature representation. It is also supervised to learn salient foreground regions in the image, which in turn guides the network to learn global contrast enhancement. We design an end-to-end training pipeline to jointly learn the saliency prediction and SESR on a shared hierarchical feature space for fast inference. Moreover, we present UFO-120, the first dataset to facilitate large-scale SESR learning; it contains over 1500 training samples and a benchmark test set of 120 samples. By thorough experimental evaluation on the UFO-120 and other standard datasets, we demonstrate that Deep SESR outperforms the existing solutions for underwater image enhancement and super-resolution. We also validate its generalization performance on several test cases that include underwater images with diverse spectral and spatial degradation levels, and also terrestrial images with unseen natural objects. Lastly, we analyze its computational feasibility for single-board deployments and demonstrate its operational benefits for visually-guided underwater robots. The model and dataset information will be available at: https://github.com/xahidbuffon/Deep-SESR.

研究动机与目标

  • 解决水下机器人因色彩失真、模糊和低对比度导致的视觉感知退化问题。
  • 将图像增强与超分辨率统一为单一、计算高效的框架,适用于近实时的机器人应用。
  • 构建大规模、带标注的数据集(UFO-120),以支持同时增强与超分辨率模型的训练与基准测试。
  • 在计算开销极小的前提下,实现对多样化水下与陆地图像条件的鲁棒、可泛化性能。
  • 证明该模型可在单板计算机上部署,实现水下机器人操作的实时视觉引导。

提出的方法

  • Deep SESR 采用残差嵌套 U-Net 架构,并通过共享的分层特征学习机制,实现增强与超分辨率的联合处理。
  • 模型采用多模态损失函数进行训练,结合感知损失、对抗损失与结构损失,以解决色彩失真、清晰度、对比度及高层特征表示问题。
  • 显著性预测与超分辨率联合训练,通过密度梯度估计实现注意力驱动的感兴趣区域(RoI)选择。
  • 网络使用 FENet-1d 和 FENet-2d 作为特征提取主干网络,其中 FENet-2d 采用并行的 3×3 与 5×5 卷积核以提升特征表示能力。
  • 端到端训练流程使增强、超分辨率与显著性预测在共享特征空间中实现联合优化。
  • 模型支持解耦推理:在 NVIDIA AGX Xavier 上,显著性与增强分支分离处理时达到 10.02 FPS,完整 SESR 模型为 7.75 FPS。

实验结果

研究问题

  • RQ1单一深度学习模型能否有效实现水下视觉系统中图像增强与超分辨率的同步处理?
  • RQ2显著性预测的联合学习如何提升感知质量并实现高效的基于 RoI 的处理?
  • RQ3与现有最先进方法相比,所提出的 Deep SESR 模型在水下与陆地图像上的 PSNR、SSIM 与 UIQM 指标上性能提升如何?
  • RQ4该模型在未见的水下环境与自然陆地场景中泛化能力如何?
  • RQ5此类模型在嵌入式单板平台上的计算可行性如何,能否支持实时机器人应用?

主要发现

  • Deep SESR 在 UFO-120 数据集上达到最先进性能,2×、3× 和 4× 超分辨率下的 PSNR 分别为 26.14、26.89 和 21.05,优于先前方法。
  • 在 Set5 数据集上 4× 超分辨率下,SSIM 达 0.925,UIQM 达 0.855,表明其具有卓越的感知质量与色彩保真度。
  • 在 Sun80 数据集上,2× 超分辨率下 SSIM 为 0.802,PSNR 为 25.73,表明其对自然图像具有强大的泛化能力。
  • 在 NVIDIA AGX Xavier 上推理速度达 7.75 FPS(每帧 129 ms),内存占用仅 10 MB,适用于嵌入式机器人部署。
  • 解耦显著性与增强分支后,推理速度提升至 10.02 FPS,支持实时 RoI 处理,额外增加 25 ms 用于详细分析。
  • 定性结果表明,增强后的图像能有效恢复颜色、对比度与清晰度,即使在多样的光谱与空间退化条件下亦表现良好。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。