Skip to main content
QUICK REVIEW

[论文解读] Conversational Group Detection With Deep Convolutional Networks

Mason Swofford, John Peruzzi|arXiv (Cornell University)|Oct 7, 2018
Video Surveillance and Tracking Methods参考文献 7被引用 5
一句话总结

本文提出一种深度卷积网络,通过识别o-spatial(社交聚集区域)来检测对话群体,结合了个体层面特征(位置、朝向)和从2D俯视图中提取的房间布局特征。该模型采用基于PointNet的架构处理无序的空间输入,在训练和验证阶段表现达到最先进水平,但因数据不平衡和测试集划分具有挑战性,测试性能有所滞后。

ABSTRACT

Detection of interacting and conversational groups from images has applications in video surveillance and social robotics. In this paper we build on prior attempts to find conversational groups by detection of social gathering spaces called o-spaces used to assign people to groups. As our contributions to the task, we are the first paper to incorporate features extracted from the room layout image, and the first to incorporate a deep network to generate an image representation of the proposed o-spaces. Specifically, this novel network builds on the PointNet architecture which allows unordered inputs of variable sizes. We present accuracies which demonstrate the ability to rival and sometimes outperform the best models, but due to a data imbalance issue we do not yet outperform existing models in our test results.

研究动机与目标

  • 通过将o-spatial建模为社交聚集区域,提升视频监控和社交机器人中的对话群体检测性能。
  • 通过引入深度学习解决先前算法方法的局限性,实现端到端的特征学习。
  • 将房间布局特征(如墙壁和桌子)引入模型,以提升o-spatial检测的空间推理能力。
  • 通过训练期间应用类别加权来缓解群体检测中的数据不平衡问题。
  • 在Cocktail Party数据集上评估模型性能,并与最先进非学习基线方法进行比较。

提出的方法

  • 使用受PointNet启发的深度神经网络,处理无序且可变大小的个体特征集(x, y, yaw)和房间布局特征。
  • 通过3D到2D的标定将摄像头图像转换为房间的2D俯视图,以实现空间布局特征的提取。
  • 对俯视图应用深度卷积网络,生成房间内o-spatial可能性的空间表征。
  • 对预测的o-spatial热力图执行非极大值抑制和阈值处理,以定位候选o-spatial区域。
  • 通过贪心分配策略将个体分配给最近检测到的o-spatial区域,从而形成对话群体。
  • 采用两种训练策略:一种为均匀类别加权,另一种为类别平衡加权,以应对多群体场景的代表性不足问题。

实验结果

研究问题

  • RQ1基于个体特征和房间布局特征,深度学习模型能否有效检测图像中的o-spatial区域?
  • RQ2与仅依赖个体特征的模型相比,引入房间布局特征是否能提升o-spatial检测的准确性?
  • RQ3数据不平衡(特别是多群体场景稀缺)如何影响模型泛化能力和测试性能?
  • RQ4尽管在验证数据集上出现过拟合,深度网络是否仍能超越非学习基线方法(如图割算法)在对话群体检测中的表现?
  • RQ5数据增强和在多样化数据集上重新训练模型在多大程度上能提升测试性能和泛化能力?

主要发现

  • 在T=1时,模型的验证F1得分为0.69,T=2/3时为0.82,分别超过先前最佳模型的F1得分0.64和0.85。
  • 训练和验证准确率均超过所有先前模型,包括最先进图割算法,表明其具备强大的学习能力。
  • 测试性能显著落后于训练和验证性能,下降原因归因于数据不平衡和测试集划分困难(包含大量难例)。
  • 类别加权略微提升了测试F1得分,但仍不足以弥补与最佳非学习模型之间的差距。
  • 模型在某些情况下可检测到两个相邻的o-spatial区域,但对空间上接近或重叠的群体仍存在困难。
  • 作者推测,若采用更具代表性的数据划分或在多样化环境数据上进一步训练,测试性能将得到改善。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。