[论文解读] GD-GAN: Generative Adversarial Networks for Trajectory Prediction and Group Detection in Crowds
本文提出GD-GAN,一种生成对抗网络框架,通过无监督深度特征学习,联合预测行人轨迹并检测人群中的社交群体。通过利用时空上下文和稀疏性正则化的GAN训练,该模型学习到任务特定的表征,实现无需人工标注数据的高精度、可迁移群体检测,在多个基准测试中优于最先进方法。
This paper presents a novel deep learning framework for human trajectory prediction and detecting social group membership in crowds. We introduce a generative adversarial pipeline which preserves the spatio-temporal structure of the pedestrian's neighbourhood, enabling us to extract relevant attributes describing their social identity. We formulate the group detection task as an unsupervised learning problem, obviating the need for supervised learning of group memberships via hand labeled databases, allowing us to directly employ the proposed framework in different surveillance settings. We evaluate the proposed trajectory prediction and group detection frameworks on multiple public benchmarks, and for both tasks the proposed method demonstrates its capability to better anticipate human sociological behaviour compared to the existing state-of-the-art methods.
研究动机与目标
- 解决在不依赖人工标注群体成员数据集的情况下检测人群社交群体的挑战。
- 学习丰富且与任务相关的行人行为表征,以编码社交身份与互动模式。
- 开发一个统一的深度学习框架,联合优化轨迹预测与群体检测。
- 通过避免在新场景中重新训练,实现在不同监控环境间的直接可迁移性。
- 通过用端到端学习的表征替代手工设计特征,改进复杂人类导航的建模。
提出的方法
- 该框架采用基于GAN的架构,其中生成器预测未来轨迹,判别器强制实现逼真的时空模式。
- 设计了一种自定义损失函数,以引导生成器学习与轨迹预测和群体检测均相关的特征。
- 对生成器的隐藏表征应用稀疏性正则化,以增强群体聚类的判别能力。
- 对生成器的上下文表征应用t-SNE降维,以提取紧凑且有意义的特征用于聚类。
- 在降维后的特征上应用DBSCAN聚类,以无监督方式检测行人群体。
- 模型通过从$T_{obs}$到$T_{pred}$的观测轨迹进行端到端训练,上下文特征从生成器的隐藏状态中提取。
实验结果
研究问题
- RQ1统一的深度学习框架能否同时提升人群中的轨迹预测与无监督群体检测?
- RQ2稀疏性正则化的GAN能否学习到比标准监督方法或普通GAN方法更具判别性的行人表征?
- RQ3所提出方法是否在无需人工标注群体注释的情况下,实现优于最先进方法的群体检测性能?
- RQ4所学习的特征在多大程度上捕捉了如邻近性、对齐性及共同目标等社交互动模式?
- RQ5该框架在不重新训练的情况下,跨不同监控场景的可迁移性如何?
主要发现
- 所提出的GD-GAN模型在CEB基准上实现79.2%的F1分数,在Student-003上实现68.4%的F1分数,优于所有消融实验变体。
- 消融研究显示,若移除GAN判别器(GD-GAN / GAN),性能显著下降(P: 73.6%,R: 75.1%),表明对抗训练的必要性。
- 引入$L_1$稀疏性正则化后,群体检测准确率超过标准cGAN基线,证明其在增强特征判别力方面的作用。
- 将GD-GAN特征与手工特征结合(GD-GAN + hf)并未显著提升性能,表明模型学习到的特征已极具信息量。
- 该模型实现实时推理,在单核CPU上处理100条轨迹(每条30个2D点)仅需0.712秒,展现出优异的时间效率。
- t-SNE投影的可视化结果表明,同一群体的轨迹在嵌入空间中聚类更紧密,验证了模型编码社交互动模式的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。