[论文解读] Learning Short-Cut Connections for Object Counting
本文提出Gated U-Net(GU-Net),一种用于目标计数的新型卷积-反卷积架构,通过在编码器和解码器层之间学习短连接作为可微分门控单元,实现自适应、可学习的信息流。通过该机制,GU-Net增强了特征融合,在人群和车辆计数基准上实现了最先进性能,且参数量少于现有模型。
Object counting is an important task in computer vision due to its growing demand in applications such as traffic monitoring or surveillance. In this paper, we consider object counting as a learning problem of a joint feature extraction and pixel-wise object density estimation with Convolutional-Deconvolutional networks. We introduce a novel counting model, named Gated U-Net (GU-Net). Specifically, we propose to enrich the U-Net architecture with the concept of learnable short-cut connections. Standard short-cut connections are connections between layers in deep neural networks which skip at least one intermediate layer. Instead of simply setting short-cut connections, we propose to learn these connections from data. Therefore, our short-cuts can work as gating units, which optimize the flow of information between convolutional and deconvolutional layers in the U-Net architecture. We evaluate the introduced GU-Net architecture on three commonly used benchmark data sets for object counting. GU-Nets consistently outperform the base U-Net architecture, and achieve state-of-the-art performance.
研究动机与目标
- 通过增强U-Net类架构中的特征融合,提升密集场景下的目标计数性能。
- 解决深度网络中固定或不可学习的跳跃连接在密度估计任务中的局限性。
- 开发一种可学习的门控机制,动态控制卷积层与反卷积层之间的信息流。
- 在不依赖ImageNet预训练的情况下,实现在标准目标计数基准上的最先进性能。
- 证明可学习的短连接在计数任务中可超越标准残差连接或跳跃连接。
提出的方法
- 在U-Net架构中,提出可学习的门控单元作为编码器和解码器层之间的动态、可微分短连接。
- 每个门控单元应用可学习的Sigmoid门控,调节编码器特征图,再与解码器特征进行拼接。
- 门控机制使网络能够根据输入数据学习应传递哪些特征及其传递程度。
- 通过在密度图上使用标准回归损失进行端到端反向传播进行训练。
- 使用基于高斯核的地面真实密度图,从标注的目标位置生成。
- 在三个基准数据集(ShanghaiTech、UCSD和PETS2009)上进行评估,使用标准指标(MAE、MSE)进行测试。
实验结果
研究问题
- RQ1可学习的短连接能否提升U-Net类架构中的特征融合与计数准确率?
- RQ2可微分门控机制与固定跳跃连接相比,在目标计数任务中表现如何?
- RQ3具有可学习门控的轻量化、非预训练模型能否在目标计数基准上实现最先进性能?
- RQ4所提出的门控机制是否在人群和车辆计数数据集上均能提升性能?
- RQ5门控机制对深度反卷积网络中的梯度流动与训练稳定性有何影响?
主要发现
- GU-Net在ShanghaiTech Part B数据集上达到最先进性能,尽管仅使用280万个参数,仍优于CSRNet和CP-CNN。
- 在ShanghaiTech Part A数据集上,GU-Net将MAE从U-Net的104.9降低至101.4,展现出对基线模型的一致性改进。
- 在UCSD数据集上,GU-Net的MAE为1.25,优于U-Net基线(1.28),且在不使用ImageNet预训练的情况下接近CSRNet(1.16)的性能。
- 该模型仅使用280万个参数,远少于CSRNet的1680万个参数(后者使用VGG16作为主干网络)。
- 消融实验证实,可学习门控在性能上优于固定跳跃连接和标准U-Net。
- 所提出的门控机制实现了更优的特征选择与信息流动,尤其在高密度场景中表现突出。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。