[论文解读] Detecting events and key actors in multi-person videos
该论文提出了一种基于注意力机制的深度学习模型,用于在无需显式标注人物的情况下,在多人视频中检测事件并识别关键参与者。通过追踪个体并在追踪到的人物特征上使用时变注意力机制的循环神经网络,该模型在包含14,000个密集事件标注的新大规模篮球视频数据集上实现了最先进性能,同时自动定位相关球员。
Multi-person event recognition is a challenging task, often with many people active in the scene but only a small subset contributing to an actual event. In this paper, we propose a model which learns to detect events in such videos while automatically "attending" to the people responsible for the event. Our model does not use explicit annotations regarding who or where those people are during training and testing. In particular, we track people in videos and use a recurrent neural network (RNN) to represent the track features. We learn time-varying attention weights to combine these features at each time-instant. The attended features are then processed using another RNN for event detection/classification. Since most video datasets with multiple people are restricted to a small number of videos, we also collected a new basketball dataset comprising 257 basketball games with 14K event annotations corresponding to 11 event classes. Our model outperforms state-of-the-art methods for both event classification and detection on this new dataset. Additionally, we show that the attention mechanism is able to consistently localize the relevant players.
研究动机与目标
- 解决在多人视频中事件识别的问题,其中仅有一小部分个体与事件相关。
- 开发一种弱监督方法,无需在训练过程中提供关键参与者显式标注,即可识别关键参与者。
- 构建一个大规模、密集标注的篮球视频数据集,以支持多人事件识别模型的稳健评估。
- 证明注意力机制可仅基于事件级监督隐式学习关键参与者的定位。
提出的方法
- 通过行人检测与重识别在帧间追踪个体,形成时间序列轨迹。
- 使用循环神经网络(RNN)对每个个体轨迹进行表示,以编码随时间变化的时空特征。
- 在RNN嵌入的轨迹特征上应用时变注意力机制,以在每个时间步动态选择最相关的个体。
- 将注意力加权后的特征输入第二个RNN进行事件分类与时间定位。
- 模型通过仅使用视频级或片段级事件标签进行端到端训练,无需任何关键参与者标注。
- 收集了一个新的大规模篮球视频数据集,包含257段长视频,涵盖11种事件类别,共14,000个密集时间标注。
实验结果
研究问题
- RQ1基于注意力机制的模型是否能在没有任何参与者位置或身份监督的情况下,自动识别多人视频中的关键参与者?
- RQ2在复杂、拥挤的场景中进行事件检测时,注意力机制在定位相关球员方面的表现如何?
- RQ3引入追踪是否能提升模型在时间上保持对关键参与者持续关注的能力?
- RQ4注意力机制在长时、未剪辑的视频中,对不同类型事件的泛化能力如何?
- RQ5该模型在新发布的、大规模的多人视频数据集上与当前最先进方法相比表现如何?
主要发现
- 所提出的模型在新篮球数据集上的事件分类与时间检测任务中均优于当前最先进方法。
- 注意力机制在识别事件片段中投手的平均平均精度达到0.618,显著优于无追踪基线模型。
- 模型在事件初期即学会关注正确的投手,例如在罚球事件中聚焦于罚球线,在三分球事件中则关注3分线外。
- 可视化结果表明,注意力空间上与事件语义一致,根据事件类型集中于投手或相关防守位置。
- 基于追踪的注意力模型倾向于在整个事件过程中固定关注单一球员,有时在罚球场景中更偏好防守球员而非投手。
- 尽管未对关键参与者提供显式监督,该模型的注意力机制在11种事件类别中的8种中可靠地定位了主要参与者,展示了强大的弱监督定位能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。