[论文解读] Domain-adaptive Crowd Counting via High-quality Image Translation and Density Reconstruction
本文提出领域自适应人群计数(DACC)方法,通过使用域间特征分离和内容感知损失,将合成人群图像翻译为更逼真的图像,随后利用高斯先验重建伪密度图以微调最终计数器,从而提升真实世界数据上的群体计数性能。DACC 在六个真实世界数据集上实现了最先进性能,相较于以往的领域自适应方法,显著降低了 MAE 和 MSE。
Recently, crowd counting using supervised learning achieves a remarkable improvement. Nevertheless, most counters rely on a large amount of manually labeled data. With the release of synthetic crowd data, a potential alternative is transferring knowledge from them to real data without any manual label. However, there is no method to effectively suppress domain gaps and output elaborate density maps during the transferring. To remedy the above problems, this paper proposes a Domain-Adaptive Crowd Counting (DACC) framework, which consists of a high-quality image translation and density map reconstruction. To be specific, the former focuses on translating synthetic data to realistic images, which prompts the translation quality by segregating domain-shared/independent features and designing content-aware consistency loss. The latter aims at generating pseudo labels on real scenes to improve the prediction quality. Next, we retrain a final counter using these pseudo labels. Adaptation experiments on six real-world datasets demonstrate that the proposed method outperforms the state-of-the-art methods.
研究动机与目标
- 解决合成数据与真实人群场景之间的域差距,该差距阻碍了人群计数中的有效迁移学习。
- 通过分离共享域特征与独立域特征,提升图像翻译质量,保留对密集人群至关重要的纹理和局部模式。
- 利用高斯核先验生成真实场景的准确伪密度图,实现对最终人群计数器的有效微调。
- 在无需真实数据人工标注的前提下,实现领域自适应人群计数的最先进性能。
提出的方法
- 提出域间特征分离(IFS)模块,采用两阶段级联架构:首先提取共享域特征(如人体结构、人群模式),随后将这些特征与独立域特征(如背景、传感器效应)结合,重建出目标域风格的图像。
- 引入多尺度对抗性翻译损失与内容感知一致性损失,在图像翻译过程中保留局部结构与纹理,相比标准 CycleGAN 损失减少失真。
- 使用在翻译后的合成图像上预训练的粗粒度计数器,生成真实场景的初始密度图。
- 采用高斯先验重建(GPR)方法,通过将粗预测与标准高斯核匹配,生成高质量伪密度图,利用头部已知的空间分布特性。
- 利用真实图像与重建的伪密度图对最终人群计数器进行微调,显著提升真实数据上的预测精度。
- 采用一种微调策略,增强密度图质量并降低误差,尤其在复杂或拥挤场景中表现更优。
实验结果
研究问题
- RQ1分离共享域与独立域特征是否能提升人群计数中从合成到真实图像翻译的质量?
- RQ2内容感知与多尺度对抗性损失是否能减少翻译后人群图像中的纹理与结构失真?
- RQ3基于高斯先验的伪密度图重建是否能提升人群计数器在真实世界数据上的性能?
- RQ4所提出的 DACC 框架是否在零样本从合成到真实数据的人群计数中优于现有领域自适应方法?
主要发现
- DACC 在六个真实世界人群计数数据集上达到最先进性能,显著优于现有领域自适应方法。
- 在 Shanghai Tech Part A 数据集上,DACC 将 MAE 从 206.7(无微调)降低至 112.4,MSE 从 297.1 降低至 176.9,接近监督学习性能(MAE 69.6,MSE 125.9)。
- 所提出的 IFS 模块有效提取了共享域特征,通过交换实验中一致的特征可视化结果,证实其鲁棒性与泛化能力。
- 基于高斯先验的伪标签重建显著提升了密度图质量,视觉对比结果表明其与真实标签的对齐程度优于基线方法。
- 该方法减少了对背景物体的误判,定性结果表明 DACC 避免了对非人群区域的过度估计。
- 消融实验表明 IFS 与 GPR 模块均不可或缺,任一模块移除后性能均显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。