Skip to main content
QUICK REVIEW

[论文解读] Temporal Dynamic Graph LSTM for Action-driven Video Object Detection

Yuan Yuan, Xiaodan Liang|arXiv (Cornell University)|Aug 2, 2017
Human Pose and Action Recognition参考文献 43被引用 14
一句话总结

本文提出了一种时间动态图LSTM(TD-Graph LSTM),用于动作驱动的弱监督视频实例检测,通过利用动作描述作为监督信号来缓解缺失标签问题。通过基于帧间对象提议之间的视觉相关性动态构建时间图,该模型实现了全局时间推理与知识迁移,在Charades数据集上实现了最先进性能,检测mAP为1.98%,分类mAP为19.52%。

ABSTRACT

In this paper, we investigate a weakly-supervised object detection framework. Most existing frameworks focus on using static images to learn object detectors. However, these detectors often fail to generalize to videos because of the existing domain shift. Therefore, we investigate learning these detectors directly from boring videos of daily activities. Instead of using bounding boxes, we explore the use of action descriptions as supervision since they are relatively easy to gather. A common issue, however, is that objects of interest that are not involved in human actions are often absent in global action descriptions known as "missing label". To tackle this problem, we propose a novel temporal dynamic graph Long Short-Term Memory network (TD-Graph LSTM). TD-Graph LSTM enables global temporal reasoning by constructing a dynamic graph that is based on temporal correlations of object proposals and spans the entire video. The missing label issue for each individual frame can thus be significantly alleviated by transferring knowledge across correlated objects proposals in the whole video. Extensive evaluations on a large-scale daily-life action dataset (i.e., Charades) demonstrates the superiority of our proposed method. We also release object bounding-box annotations for more than 5,000 frames in Charades. We believe this annotated data can also benefit other research on video-based object recognition in the future.

研究动机与目标

  • 为解决弱监督视频实例检测中的缺失标签问题,即未参与动作描述的对象类别常被遗漏检测。
  • 利用视频中的时间连贯性,将动作标注帧的知识迁移至未标注帧中未涉及的对象。
  • 设计一种基于动态图的循环架构,自适应地建模帧间对象提议之间的时序相关性。
  • 在仅含最小监督的情况下,提升日常场景视频中小型和遮挡对象的检测性能。
  • 发布一个包含超过5,000帧带边界框的新标注数据集,以支持未来的视频识别研究。

提出的方法

  • TD-Graph LSTM 构建一个动态时间图,其中节点代表所有帧中的对象提议,边则根据连续帧中提议之间的视觉相似性自适应形成。
  • 在每个时间步,仅将最相似的提议通过边连接,从而实现在图中自适应且上下文感知的信息传播。
  • 模型使用LSTM单元沿动态图处理序列特征,实现长距离时间推理与特征优化。
  • 图边根据当前特征表示迭代更新,使模型能够基于学习到的视觉相关性动态演化其连接结构。
  • 通过动态图结构在整个视频中传播动作知识,联合优化检测与分类任务。
  • 消融研究对比了动态图与静态图、全连接图及均值加权图,以验证自适应拓扑学习的有效性。

实验结果

研究问题

  • RQ1能否有效建模视频中对象提议之间的时间相关性,以缓解弱监督检测中的缺失标签问题?
  • RQ2相较于固定或静态图拓扑,随时间与模型状态演变的动态图结构是否能提升检测性能?
  • RQ3能否有效利用动作描述来推断未明确标注帧中未涉及对象的存在?
  • RQ4通过在动态图上集成LSTM进行时间推理,对小型和遮挡对象的检测精度有何影响?
  • RQ5当仅提供部分标签时,全局视频级动作知识在多大程度上能提升帧级对象检测性能?

主要发现

  • 所提出的TD-Graph LSTM在Charades数据集上实现了1.98%的检测mAP和19.52%的分类mAP,分类mAP相比最先进方法高出3.85%。
  • 模型在小型物体检测上性能提升显著,对枕头类别的检测mAP提升超过14.13%,对杯子类别的提升达6.93%,证明其在挑战性检测场景中的有效性。
  • 消融研究证实,动态图结构显著优于静态图和均值加权图基线,验证了自适应边选择的价值。
  • 移除图组件后,检测mAP降至1.55%,证实图结构的知识迁移对性能提升至关重要。
  • 包含LSTM单元的模型优于无LSTM的变体,验证了序列建模在捕捉复杂运动模式中的重要性。
  • 定性结果表明,与基线相比,该模型在小型和遮挡对象(如杯子和沙发)上的检测精度更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。