[论文解读] Focus on Semantic Consistency for Cross-domain Crowd Understanding
该论文提出了一种用于跨域人群计数的域自适应框架,通过增强合成数据与真实场景之间的人群区域语义一致性,减少背景估计误差,并在三个真实世界数据集上实现了最先进(SOTA)的性能表现,相较于基线模型,平均绝对误差(MAE)降低了31.3%。
For pixel-level crowd understanding, it is time-consuming and laborious in data collection and annotation. Some domain adaptation algorithms try to liberate it by training models with synthetic data, and the results in some recent works have proved the feasibility. However, we found that a mass of estimation errors in the background areas impede the performance of the existing methods. In this paper, we propose a domain adaptation method to eliminate it. According to the semantic consistency, a similar distribution in deep layer's features of the synthetic and real-world crowd area, we first introduce a semantic extractor to effectively distinguish crowd and background in high-level semantic information. Besides, to further enhance the adapted model, we adopt adversarial learning to align features in the semantic space. Experiments on three representative real datasets show that the proposed domain adaptation scheme achieves the state-of-the-art for cross-domain counting problems.
研究动机与目标
- 解决在使用合成数据进行跨域人群计数时,背景估计误差过高的问题。
- 缩小合成数据(GCC)与真实世界数据(Shanghai Tech, UCF-QNRF)之间的域差距。
- 通过聚焦人群区域的高层特征语义一致性,提升人群计数性能。
- 开发一种结合语义监督与对抗性特征对齐的域自适应框架。
- 在低密度与高密度人群计数基准上实现最先进性能。
提出的方法
- 使用GCC数据集中的人群掩码训练语义提取网络,为人群区域生成高层语义标签。
- 采用基于VGG16的特征提取器并加入批量归一化,从源域(合成)和目标域(真实)图像中提取深层特征。
- 通过特征判别器应用对抗学习,对齐源域与目标域在语义空间中的深层特征分布。
- 采用多任务损失函数,联合优化人群计数损失、语义分割损失与对抗损失。
- 应用场景正则化,从大规模GCC数据集中选择代表性图像,避免训练过程中的负域偏移。
- 使用Adam优化器,以1e-5的低初始学习率和8的批量大小,在480×640裁剪输入上进行模型训练。
实验结果
研究问题
- RQ1聚焦高层特征中的语义一致性是否能有效减小跨域人群计数中的域差距?
- RQ2利用人群特异性语义监督是否能提升从合成数据到真实数据的泛化能力?
- RQ3在语义空间中进行对抗性特征对齐是否优于图像风格迁移方法(如SE Cycle GAN)?
- RQ4所提方法在低密度与高密度人群数据集上的表现如何?
- RQ5与现有域自适应方法相比,该方法在多大程度上减少了背景估计误差?
主要发现
- 在Shanghai Tech Part B数据集上,该方法实现了16.9的MAE与24.7的MSE,相较于基线模型分别降低了31.3%与26.7%的误差。
- 在UCF-QNRF数据集上,该方法在MAE与MSE上均优于最先进方法SE Cycle GAN,展现出在高度密集场景中的更优泛化能力。
- 可视化结果表明,采用域自适应生成的密度图相较于未使用域自适应的方法更接近真实密度图,尤其在背景区域表现更优。
- 该方法提升了PSNR与SSIM指标,表明预测密度图的质量更优。
- 消融实验证实,语义提取器与对抗性对齐均对性能提升有贡献,其中语义模块在减少背景噪声方面尤为关键。
- 该框架在不同数据集间具有良好的泛化能力,在低密度(Shanghai Tech)与高密度(UCF-QNRF)人群计数基准上均取得了SOTA性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。