Skip to main content
QUICK REVIEW

[论文解读] Revisiting Shadow Detection: A New Benchmark Dataset for Complex World

Xiaowei Hu, Tianyu Wang|arXiv (Cornell University)|Nov 16, 2019
Video Surveillance and Tracking Methods参考文献 53被引用 8
一句话总结

本文提出了CUHK-Shadow数据集,这是一个大规模基准数据集,包含10,500张真实世界阴影图像及其密集掩码,涵盖多样化的场景、投射阴影与自阴影,并包含验证集划分。本文提出FSDNet,一种轻量级深度神经网络,结合细节增强模块与方向感知上下文聚合机制,在仅400万个参数下实现SOTA性能并支持实时推理,显著优于先前方法,在复杂真实世界阴影检测任务中表现优异。

ABSTRACT

Shadow detection in general photos is a nontrivial problem, due to the complexity of the real world. Though recent shadow detectors have already achieved remarkable performance on various benchmark data, their performance is still limited for general real-world situations. In this work, we collected shadow images for multiple scenarios and compiled a new dataset of 10,500 shadow images, each with labeled ground-truth mask, for supporting shadow detection in the complex world. Our dataset covers a rich variety of scene categories, with diverse shadow sizes, locations, contrasts, and types. Further, we comprehensively analyze the complexity of the dataset, present a fast shadow detection network with a detail enhancement module to harvest shadow details, and demonstrate the effectiveness of our method to detect shadows in general situations.

研究动机与目标

  • 为解决现有阴影检测基准的局限性,即场景类型多样性不足、阴影类型(尤其是自阴影)缺乏,且缺乏合理的验证集划分。
  • 收集并标注一个大规模、多样化且逼真的数据集,以反映真实世界阴影场景的复杂性。
  • 开发一种快速且高精度的深度神经网络FSDNet,能够在复杂真实世界条件下以高保真度和低计算成本检测阴影。
  • 证明在现有数据集上训练的SOTA模型在新基准上表现失败,凸显对更鲁棒、泛化能力更强的阴影检测方法的迫切需求。

提出的方法

  • 作者从五个多样化来源(城市、建筑、卫星地图、道路和室内场景)收集了10,500张真实世界图像,每张图像均配有像素级真实标签阴影掩码。
  • 数据集包含背景物体上的投射阴影以及遮挡物体上的自阴影,提升了真实感与复杂度。
  • 包含验证集以支持超参数调优与消融实验,降低过拟合风险。
  • 提出FSDNet作为轻量级网络,引入方向感知空间上下文模块,从高层特征中聚合全局上下文信息。
  • 设计细节增强模块,从低层特征中恢复精细阴影细节,提升定位精度。
  • 采用平衡交叉熵损失进行端到端训练,并在新基准上评估,与SOTA方法进行对比。

实验结果

研究问题

  • RQ1当在更复杂、真实世界基准上评估时,现有SOTA阴影检测模型的性能如何退化?
  • RQ2当前数据集在多大程度上无法体现真实世界阴影场景的多样性,包括场景类型、阴影类型(投射 vs. 自阴影)以及背景复杂度?
  • RQ3轻量级深度学习模型能否在不依赖重型网络架构的前提下,实现在复杂真实世界阴影检测中的高精度与实时推理?
  • RQ4不同场景类别之间的域偏移如何影响阴影检测模型的泛化能力?

主要发现

  • FSDNet在新的CUHK-Shadow基准上达到SOTA性能,在准确率与推理速度方面均优于现有方法。
  • 该模型在测试集上的平衡错误率(BER)为4.8%,显著优于以往方法在旧基准上实现的BER <4%,但这些方法在本新、更复杂的基准上表现失败。
  • FSDNet仅含400万个参数,支持实时推理(每张图像低于20ms),适用于实时应用场景部署。
  • 当应用于未见过的场景类别时,模型性能显著下降,表明存在显著的域偏移,亟需域泛化模型。
  • 数据集的复杂性得到量化:平均阴影区域占比为12.3%,单张图像最多含15个阴影,且阴影与非阴影区域间对比度差异显著。
  • 仅对FSDNet掩码检测出的阴影区域应用直方图均衡化,即可提升阴影中人物的目标检测性能,证明其在视觉处理流水线中的实际应用价值。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。