[论文解读] Social Scene Understanding: End-to-End Multi-Person Action Localization and Collective Activity Recognition
本文提出一种端到端深度学习框架,通过一次前向传播即可联合检测多人、识别其个体社交行为,并推断集体群体活动。该方法利用共享的多尺度特征、基于概率推理的新型检测方案以及针对时间建模的个体级RNN,在不依赖外部检测或跟踪流水线的情况下,实现了基准数据集上的最先进性能。
We present a unified framework for understanding human social behaviors in raw image sequences. Our model jointly detects multiple individuals, infers their social actions, and estimates the collective actions with a single feed-forward pass through a neural network. We propose a single architecture that does not rely on external detection algorithms but rather is trained end-to-end to generate dense proposal maps that are refined via a novel inference scheme. The temporal consistency is handled via a person-level matching Recurrent Neural Network. The complete model takes as input a sequence of frames and outputs detections along with the estimates of individual actions and collective activities. We demonstrate state-of-the-art performance of our algorithm on multiple publicly available benchmarks.
研究动机与目标
- 开发一个统一的深度学习框架,以在原始视频序列中联合执行多人检测、个体动作识别和集体活动识别。
- 克服依赖独立检测、跟踪和特征提取阶段的串行流水线的局限性,这些方法通常会丢失上下文和交互线索。
- 实现无需外部真实检测或跟踪标注的端到端训练,提升鲁棒性与效率。
- 通过个体级匹配RNN对时间一致性进行建模,无需预计算轨迹即可随时间推理。
- 在多人动作理解基准数据集(包括volleyball和brainwash数据集)上展示最先进性能。
提出的方法
- 全卷积网络(FCN)处理每一帧,生成在所有任务间共享的多尺度特征图。
- 专用全卷积检测网络(DFCN)生成密集的检测提议,包含边界框和置信度分数。
- 混合马尔可夫随机场(MRF)执行联合概率推理,以优化检测假设,替代贪婪的非极大值抑制。
- 从优化后的检测结果中提取个体嵌入向量,并输入循环神经网络(RNN)以建模时间一致性并预测个体与集体动作。
- 模型通过检测损失(L_det)和动作识别损失(L_CI)的独立损失函数进行端到端训练,实现联合优化。
- 采用基于学习嵌入向量的新型匹配策略,相较于基于坐标的匹配方法,在人群密集场景中显著提升检测关联性能。
实验结果
研究问题
- RQ1统一的深度学习模型能否在原始视频序列中联合定位多人、识别其个体社交行为,并推断集体群体活动?
- RQ2与串行流水线相比,使用共享多尺度特征的端到端训练在性能上如何提升?
- RQ3在人群密集场景中,基于概率推理的检测方案在多大程度上优于贪婪的非极大值抑制?
- RQ4通过个体级RNN进行时间建模是否能提升动作识别准确率,特别是对集体活动而言?
- RQ5所提方法是否能在不依赖外部检测或跟踪标注的情况下实现最先进性能?
主要发现
- 在volleyball数据集上,采用MRF检测与嵌入匹配方法,该方法在集体活动识别上达到87.1%的平均准确率,在个体动作识别上达到77.9%。
- 在brainwash数据集上,该模型优于Faster R-CNN和ReInspect,实现88%的平均精度与87%的相等错误率,与ReInspect-rezoom性能相当。
- 基于嵌入的匹配方法(embed和embed-soft)相较于基于坐标的匹配方法(boxes)显著提升性能,尤其在使用预测检测结果而非真实标注时更为明显。
- 通过混合MRF实现的联合推理提升了检测质量,并在动作识别上优于非极大值抑制,如表3所示。
- 个体级RNN提升了集体活动识别性能,但对个体动作识别的增益有限,表明通过空间池化捕捉细微动作动态存在局限性。
- 该模型展现出强大的泛化能力,在无需测试时使用真实检测或跟踪标注的情况下,于多个基准上均取得最先进结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。