[论文解读] Single Image Reflection Removal Exploiting Misaligned Training Data and Network Enhancements
该论文提出了一种新颖的深度学习方法,通过整合上下文感知网络增强与对齐不变损失函数,利用存在错位的现实世界训练数据,实现单张图像去反射。通过嵌入通道注意力与多尺度空间上下文模块,并在易于收集的错位图像对上进行训练,该方法在真实世界基准上实现了最先进性能,显著提升了去反射效果与背景重建精度。
Removing undesirable reflections from a single image captured through a glass window is of practical importance to visual computing systems. Although state-of-the-art methods can obtain decent results in certain situations, performance declines significantly when tackling more general real-world cases. These failures stem from the intrinsic difficulty of single image reflection removal -- the fundamental ill-posedness of the problem, and the insufficiency of densely-labeled training data needed for resolving this ambiguity within learning-based neural network pipelines. In this paper, we address these issues by exploiting targeted network enhancements and the novel use of misaligned data. For the former, we augment a baseline network architecture by embedding context encoding modules that are capable of leveraging high-level contextual clues to reduce indeterminacy within areas containing strong reflections. For the latter, we introduce an alignment-invariant loss function that facilitates exploiting misaligned real-world training data that is much easier to collect. Experimental results collectively show that our method outperforms the state-of-the-art with aligned data, and that significant improvements are possible when using additional misaligned data.
研究动机与目标
- 为解决由于反射层与透射层分解不明确而导致的单张图像去反射(SIRR)问题的根本不适定性。
- 通过允许使用在最小约束条件下收集的错位图像对,克服真实世界训练数据中密集标注样本稀缺的问题。
- 通过引入捕捉全局空间与通道上下文的上下文编码模块,增强深度神经网络,以提升去反射性能。
- 设计一种对齐不变损失函数,使网络能够在无需精确空间对应关系的情况下,有效利用错位的真实世界数据进行训练。
- 证明架构增强与错位数据利用的联合效应,可显著提升真实世界SIRR基准上的性能表现。
提出的方法
- 引入通道注意力机制,基于全局激活统计量重新加权特征图,增强对反射抑制的判别能力。
- 在特征金字塔各层级上聚合多尺度空间上下文,实现空间表征中的全局上下文一致性。
- 设计一种对齐不变损失函数,通过最小化重建误差,使网络能够在无需像素级对应关系的情况下,对错位图像对进行有效训练。
- 采用改进的U-Net式编码器-解码器架构,并引入上下文编码模块,以提升去反射任务的特征表示能力。
- 在对齐真实数据与使用DSLR和智能手机相机拍摄的大量错位真实世界图像对组合数据上进行网络训练。
- 在真实世界数据集上通过同时使用对齐与错位数据进行微调,并通过人类偏好评估验证性能提升。
实验结果
研究问题
- RQ1当 I = T + R 的分解本质上不适定的情况下,上下文感知网络设计能否降低去反射任务中的歧义性?
- RQ2是否可以有效利用易于收集但无严格相机或场景稳定性要求的错位真实世界图像对,用于SIRR深度网络的训练?
- RQ3对齐不变损失函数是否能够在不损害对齐数据性能的前提下,实现对错位数据的有效训练?
- RQ4架构增强与错位数据利用在多大程度上共同提升真实世界基准上的SIRR性能?
- RQ5所提方法是否能在包括复杂野外场景在内的多样化真实世界测试集上超越现有最先进模型?
主要发现
- 所提出的ERRNet在‘Real20’和‘Objects’数据集上达到最先进性能,PSNR、SSIM与NCC指标均优于先前SOTA方法。
- 在‘Postcard’数据集上,ERRNet与表现最佳的BDN-F模型结果相当,展现出在不同场景类型下的强大泛化能力。
- 在‘Wild’数据集上,无方法优于输入图像,表明在复杂、非约束环境下仍有巨大提升空间。
- 人类偏好评估显示,当在错位数据上微调时,54%的用户更偏好微调后的ERRNet,而BDN-F仅为36%,表明用户对所提方法的偏好更强。
- 对齐不变损失在错位数据微调时显著提升了视觉与定量性能,观察者一致偏好增强后的结果。
- 视觉结果表明,与基线方法相比,ERRNet能更准确地去除如窗户上的树枝等强烈反射。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。