[论文解读] Physics Informed and Data Driven Simulation of Underwater Images via Residual Learning
该论文提出了一种融合物理先验与数据驱动的深度学习框架,通过结合已知的图像形成模型与残差学习网络,模拟逼真的水下图像退化过程。该方法从RGB图像中估计深度,利用复杂的图像形成模型生成真实图像,其在模拟逼真水下失真方面优于纯数据驱动模型,且具有更高的可解释性与可微性。
In general, underwater images suffer from color distortion and low contrast, because light is attenuated and backscattered as it propagates through water (differently depending on wavelength and on the properties of the water body). An existing simple degradation model (similar to atmospheric image "hazing" effects), though helpful, is not sufficient to properly represent the underwater image degradation because there are unaccounted for and non-measurable factors e.g. scattering of light due to turbidity of water, reflective characteristics of turbid medium etc. We propose a deep learning-based architecture to automatically simulate the underwater effects where only a dehazing-like image formation equation is known to the network, and the additional degradation due to the other unknown factors if inferred in a data-driven way. We only use RGB images (because in real-time scenario depth image is not available) to estimate the depth image. For testing, we have proposed (due to the lack of real underwater image datasets) a complex image formation model/equation to manually generate images that resemble real underwater images (used as ground truth). However, only the classical image formation equation (the one used for image dehazing) is informed to the network. This mimics the fact that in a real scenario, the physics are never completely known and only simplified models are known. Thanks to the ground truth, generated by a complex image formation equation, we could successfully perform a qualitative and quantitative evaluation of proposed technique, compared to other purely data driven approaches
研究动机与目标
- 开发一种能够考虑标准大气模型之外复杂、不可测量物理因素的逼真水下图像退化模拟方法。
- 构建一个可微、可解释的水下图像形成深度学习模拟器,可用于图像复原等逆问题。
- 仅使用RGB图像与估计深度进行模型训练,避免在真实场景中依赖昂贵的RGB-D传感器。
- 利用复杂的图像形成模型生成干净-退化图像对的合成数据集,作为训练与评估的基准真实值。
- 在保持物理合理性的前提下,优于纯数据驱动的图像到图像翻译模型(如Pix2Pix、CycleGAN)在模拟水下图像效果方面的表现。
提出的方法
- 一种深度神经网络架构将硬编码的经典图像形成方程(类似于去雾模型)与残差学习分支相结合,以建模未被考虑的退化因素。
- 通过学习的编码器-解码器网络从RGB图像中估计深度图,使基于物理的组件无需直接输入深度即可应用。
- 手动设计并使用一个复杂、多组件的图像形成模型,生成逼真的水下图像对作为真实值,模拟真实世界的退化过程。
- 通过对抗性损失、感知损失与重建损失的组合进行网络训练,以确保颜色、对比度与结构保真度的真实性。
- 残差学习组件学习简单物理模型输出与真实值之间的差异,捕捉缺失的散射与浑浊效应。
- 通过PyTorch实现训练模型的完全可微性,使其可用于通过优化求解逆问题(如水下图像复原)。
实验结果
研究问题
- RQ1当仅有简化物理模型与RGB图像可用时,深度学习模型能否有效模拟水下图像退化?
- RQ2当在由复杂图像形成模型生成的合成数据上进行训练时,残差学习网络在捕捉不可测量的物理效应(如浑浊与散射)方面表现如何?
- RQ3与纯数据驱动方法相比,引入已知物理模型在多大程度上提升了模拟水下图像的真实感与可解释性?
- RQ4训练后的模型能否作为求解逆问题(如水下图像复原)的可微分物理模拟器?
- RQ5与SOTA图像到图像翻译模型(如Pix2Pix与CycleGAN)相比,所提方法在模拟水下退化方面的性能如何?
主要发现
- 所提方法在模拟逼真水下图像退化方面优于纯数据驱动模型(如Pix2Pix与CycleGAN),尤其在捕捉复杂散射与颜色失真方面表现更优。
- 所提架构的Variant-2在所有指标上均保持与核心方法或Variant-1相当或更优的性能,表明其对网络结构变化具有鲁棒性。
- 即使未实现完美颜色重建,该模型仍能有效模拟强烈的水下模糊与颜色偏移效应,证明其对退化过程的建模能力出色。
- 利用复杂图像形成模型生成真实值,使得在缺乏真实水下数据集的情况下,仍能实现高质量训练与可靠评估。
- 训练后的模型完全可微,可作为可微分物理模拟器用于求解逆问题(如图像复原),这是其相对于黑箱模型的关键优势。
- 结果表明,将物理先验与数据驱动的残差学习相结合,可构建比纯数据驱动方法更具可解释性与泛化能力的模拟器。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。