Skip to main content
QUICK REVIEW

[论文解读] Atmospheric turbulence removal using convolutional neural network

Jing Gao, Nantheera Anantrasirichai|arXiv (Cornell University)|Dec 22, 2019
Advanced Image Processing Techniques参考文献 13被引用 16
一句话总结

本文提出一种基于深度学习的方法,采用改进的残差U-Net架构,以恢复受大气湍流退化的视频序列。通过利用端到端的时空残差学习与批量归一化进行训练,该模型有效去除了模糊、波纹效应并增强了对比度,在真实世界数据上相比最先进方法,PSNR最高提升3.8%,推理速度提升23倍。

ABSTRACT

This paper describes a novel deep learning-based method for mitigating the effects of atmospheric distortion. We have built an end-to-end supervised convolutional neural network (CNN) to reconstruct turbulence-corrupted video sequence. Our framework has been developed on the residual learning concept, where the spatio-temporal distortions are learnt and predicted. Our experiments demonstrate that the proposed method can deblur, remove ripple effect and enhance contrast of the video sequences simultaneously. Our model was trained and tested with both simulated and real distortions. Experimental results of the real distortions show that our method outperforms the existing ones by up to 3.8% in term of the quality of restored images, and it achieves faster speed than the state-of-the-art methods by up to 23 times with GPU implementation.

研究动机与目标

  • 为解决传统图像处理方法在大气湍流恢复中的局限性,如计算成本高、优化复杂及需手动调节参数。
  • 开发一种端到端的深度学习框架,能够联合实现去模糊、去除波纹及增强对比度,以恢复湍流视频序列。
  • 实现实时、即时的视频序列恢复,仅需最少输入——单帧或数帧的平均值——无需预先选择高质量帧。
  • 通过采用更大的感受野与残差学习,改进DnCNN架构,提升在复杂未知湍流模式的真实场景下的鲁棒性与性能。

提出的方法

  • 该方法采用基于DnCNN改进的U-Net类残差卷积神经网络(CNN),将滤波器尺寸扩展为 $ n \times n $(其中 $ n > 3 $),以增大感受野,捕捉时空失真。
  • 采用残差学习建模退化输入与真实值之间的差异,损失函数定义为均方误差:$ L(\theta) = \frac{1}{2m} \sum_{i=1}^{m} |R(y_i;\theta) - (y_i - x_i)|^2 $。
  • 使用配对的退化图像与真实图像数据进行反向传播训练,以最小化重建误差。
  • 评估了两种输入策略:单帧输入与多帧平均输入(如20–30帧),后者在复杂真实场景中显著提升稳定性和性能。
  • 在每一层应用批量归一化,以加速训练并改善收敛性。
  • 通过GPU加速实现模型部署,实现在512×256视频帧上每秒处理1638.4k像素的实时处理性能。

实验结果

研究问题

  • RQ1深度CNN能否有效学习并逆转由大气湍流引起的复杂时空失真?
  • RQ2与标准DnCNN相比,采用更大感受野的残差学习是否能提升湍流去除的恢复质量?
  • RQ3在真实世界数据中,该模型能否仅凭单张退化帧输入实现优异性能,还是必须依赖多帧平均才能获得稳定结果?
  • RQ4在实时场景中,该方法与现有SOTA方法(如CW和CSP)相比,在速度与质量方面表现如何?

主要发现

  • 在真实世界数据集上,该方法相比SOTA方法PSNR最高提升3.8%,在'chimney'序列中达到最高PSNR 33.68 dB。
  • 在'building'序列中,采用平均输入时PSNR达26.02 dB,优于CSP(25.37 dB)与CW(25.18 dB)。
  • 在GPU上实现每帧0.08秒的处理速度(1638.4k像素/秒),相比CW方法(70.6k像素/秒)快23倍。
  • 主观评估显示,该方法在保留细节与减少伪影方面优于CSP与CW,视觉效果更优。
  • 使用多帧平均输入显著提升恢复质量,在'chimney'序列中SSIM达0.97,'building'序列中达0.88,优于CW与CSP。
  • 在包含运动物体的动态场景(如'moving car'序列)中,模型表现出鲁棒性,平均输入结果接近真实值,优于现有方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。