Skip to main content
QUICK REVIEW

[论文解读] Learning Video Representations from Correspondence Proposals

Xingyu Liu, Joon‐Young Lee|arXiv (Cornell University)|May 20, 2019
Human Pose and Action Recognition参考文献 39被引用 10
一句话总结

该论文提出CPNet,一种新颖的视频表征学习框架,通过在语义空间中聚合k近邻对应关系来建模长程运动与动态内容。通过将视频特征视为点云,并使用可学习的CP模块结合最大池化对应嵌入,CPNet仅使用RGB输入且参数量少于先前方法,在Something-Something和Jester数据集上达到最先进性能,在Kinetics数据集上也达到最先进水平。

ABSTRACT

Correspondences between frames encode rich information about dynamic content in videos. However, it is challenging to effectively capture and learn those due to their irregular structure and complex dynamics. In this paper, we propose a novel neural network that learns video representations by aggregating information from potential correspondences. This network, named $CPNet$, can learn evolving 2D fields with temporal consistency. In particular, it can effectively learn representations for videos by mixing appearance and long-range motion with an RGB-only input. We provide extensive ablation experiments to validate our model. CPNet shows stronger performance than existing methods on Kinetics and achieves the state-of-the-art performance on Something-Something and Jester. We provide analysis towards the behavior of our model and show its robustness to errors in proposals.

研究动机与目标

  • 为解决从帧间不规则、长程对应关系中学习有效视频表征的挑战。
  • 在不依赖光流或复杂时空操作的情况下建模视频中的动态内容。
  • 开发一种能够有效聚合并从一组潜在对应关系中学习,同时保持时间一致性的模块。
  • 仅使用RGB输入,实现外观与运动特征的端到端联合学习。
  • 提升对视频识别中噪声或错误对应关系提议的鲁棒性。

提出的方法

  • CP模块将视频特征张量视为C维语义空间中的T×H×W个点的点云。
  • 对于每个点(特征),使用语义特征空间中的L2距离,识别其他帧中k个最近邻(潜在对应关系)。
  • 每个k个对应对由共享的多层感知机(MLP)独立处理,以计算对应嵌入。
  • 对k个嵌入应用最大池化,以选择最显著的对应关系,从而过滤掉弱或错误的提议。
  • CP模块整合时空位置信息(时间与空间偏移),以保持运动结构并实现时间一致性。
  • CP模块被集成到CNN主干网络中,以联合学习静态外观与动态运动表征,形成CPNet架构。

实验结果

研究问题

  • RQ1可学习的对应关系聚合机制是否能仅使用RGB输入,有效建模视频中的长程运动?
  • RQ2在训练和推理过程中,CP模块如何处理噪声或错误的对应关系提议?
  • RQ3基于点云的对应模块在视频识别中,与局部或全局注意力机制相比,其性能优势在多大程度上体现?
  • RQ4CP模块能否泛化到不同的视频识别架构和基准数据集?
  • RQ5在语义层面学习对应关系与在像素层面使用光流相比,在捕捉运动动态方面表现如何?

主要发现

  • CPNet在Something-Something和Jester数据集上达到最先进性能,优于先前仅使用RGB输入且参数量更少的方法。
  • 在Kinetics数据集上,CPNet超越了现有方法,展现出在动作识别任务中强大的泛化能力与性能提升。
  • CP模块对错误对应关系提议表现出鲁棒性,因为最大池化能有效过滤掉无信息量或错误的匹配。
  • 可视化结果表明,CP模块主要修改与运动物体对应的特征,表明其具备有效的运动建模能力。
  • 即使缺乏显式的运动监督,CP模块也能基于语义相似性学习提出有意义的对应关系。
  • CPNet可简化为或推广至C3D、NL-Net和TRN等现有架构,显示出其灵活性与理论基础。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。