[论文解读] LAFFNet: A Lightweight Adaptive Feature Fusion Network for Underwater Image Enhancement
LAFFNet 提出了一种轻量级、端到端可训练的卷积神经网络,用于水下图像增强,通过使用多尺度卷积和通道注意力的自适应特征融合(AFF)模块,替代了传统编码器-解码器结构中的下采样和上采样操作。该模型将参数量从 2.5M 减少至 0.15M(减少 94%),在 EUVP 和 UFO-120 数据集上达到最先进性能,并提升了显著性检测和深度估计等下游任务的表现。
Underwater image enhancement is an important low-level computer vision task for autonomous underwater vehicles and remotely operated vehicles to explore and understand the underwater environments. Recently, deep convolutional neural networks (CNNs) have been successfully used in many computer vision problems, and so does underwater image enhancement. There are many deep-learning-based methods with impressive performance for underwater image enhancement, but their memory and model parameter costs are hindrances in practical application. To address this issue, we propose a lightweight adaptive feature fusion network (LAFFNet). The model is the encoder-decoder model with multiple adaptive feature fusion (AAF) modules. AAF subsumes multiple branches with different kernel sizes to generate multi-scale feature maps. Furthermore, channel attention is used to merge these feature maps adaptively. Our method reduces the number of parameters from 2.5M to 0.15M (around 94% reduction) but outperforms state-of-the-art algorithms by extensive experiments. Furthermore, we demonstrate our LAFFNet effectively improves high-level vision tasks like salience object detection and single image depth estimation.
研究动机与目标
- 解决现有基于深度学习的水下图像增强模型在资源受限的海洋机器人上部署时计算量和内存占用过高的问题。
- 克服传统编码器-解码器架构依赖参数量大的下采样和上采样操作的局限性。
- 开发一种轻量级网络,在不假设固定物理参数的前提下,通过多尺度特征提取和自适应融合保持高性能。
- 证明增强图像在提升高层视觉任务(如显著性检测和单图深度估计)方面的泛化能力。
提出的方法
- 提出一种自适应特征融合(AFF)模块,通过应用不同尺寸的卷积核从单个特征图中提取多尺度特征。
- 引入通道注意力机制,动态分配不同尺度特征图的权重,实现基于特征重要性的自适应融合。
- 采用残差块以稳定训练过程,并缓解深层网络中的梯度消失问题。
- 通过减少所有卷积层中的通道数来降低模型复杂度,而非使用深度可分离卷积或紧凑卷积。
- 设计一种类似 U-Net 的架构,但不包含下采样和上采样操作,完全依赖 AFF 模块和残差模块。
- 在目标函数中引入感知损失,以提升增强图像的感知质量。
实验结果
研究问题
- RQ1轻量级 CNN 架构是否能在大幅减少模型参数的同时实现最先进水平的水下图像增强性能?
- RQ2所提出的结合多尺度卷积和通道注意力的自适应特征融合(AFF)模块,在替代传统下采样和上采样操作方面效果如何?
- RQ3LAFFNet 增强的图像质量在多大程度上提升了高层视觉任务(如显著性检测和深度估计)的表现?
- RQ4残差学习与通道注意力的结合在低光照水下图像恢复任务中对性能提升的贡献有多大?
- RQ5参数高效的网络是否能在不假设固定物理参数的前提下,跨多种水下图像数据集保持高性能?
主要发现
- LAFFNet 将模型参数量从 2.5M 减少至 0.15M,相比基线模型减少 94%。
- 在 EUVP 数据集上,LAFFNet 的 UIQM 得分为 3.092,优于所有最先进方法,包括 FUnIE-GAN(2.514)和 Deep SESR(2.638)。
- 在 UFO-120 数据集上,LAFFNet 的 PSNR 达到 28.94,SSIM 达到 0.86,两项指标均超越此前方法。
- 消融实验表明,残差模块贡献 +2.41 PSNR,AFF 模块增加 +0.47 PSNR,感知损失进一步将 PSNR 提升 +0.17。
- LAFFNet 增强的图像在显著性目标检测和单图深度估计任务中表现显著提升,视觉对比结果表明其优于原始图像和基线增强结果。
- 轻量级架构支持在真实机器人系统中高效部署,可无缝集成至高层视觉处理流水线。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。