Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Video Classification via Temporal Alignment

Kaidi Cao, Jingwei Ji|arXiv (Cornell University)|Jun 27, 2019
Human Pose and Action Recognition参考文献 46被引用 16
一句话总结

本文提出时间对齐模块(TAM),一种少样本视频分类框架,通过学习查询视频与支持集代理之间的自适应对齐路径,显式建模长期时间顺序。通过使用连续松弛实现端到端训练,TAM在仅每类一个标注样本的情况下,在Kinetics和Something-Something-V2数据集上相比均值池化基线模型,将top-1准确率提升了约8%,达到当前最先进性能。

ABSTRACT

There is a growing interest in learning a model which could recognize novel classes with only a few labeled examples. In this paper, we propose Temporal Alignment Module (TAM), a novel few-shot learning framework that can learn to classify a previous unseen video. While most previous works neglect long-term temporal ordering information, our proposed model explicitly leverages the temporal ordering information in video data through temporal alignment. This leads to strong data-efficiency for few-shot learning. In concrete, TAM calculates the distance value of query video with respect to novel class proxies by averaging the per frame distances along its alignment path. We introduce continuous relaxation to TAM so the model can be learned in an end-to-end fashion to directly optimize the few-shot learning objective. We evaluate TAM on two challenging real-world datasets, Kinetics and Something-Something-V2, and show that our model leads to significant improvement of few-shot video classification over a wide range of competitive baselines.

研究动机与目标

  • 为解决新类别标注数据极度有限的少样本视频分类挑战。
  • 显式建模视频中的长期时间顺序,该问题在先前方法中常被忽略。
  • 开发一种可微分框架,可端到端学习对齐路径以提升数据效率。
  • 克服视频间非线性时间变化带来的准确少样本分类障碍。
  • 在极少监督条件下,超越现有基线在真实世界视频数据集上的表现。

提出的方法

  • TAM通过在查询视频与支持视频特征之间学习的对齐路径上,对帧级余弦距离进行平均,计算时间对齐得分。
  • 对齐路径通过带连续松弛的动态规划确定,支持端到端反向传播。
  • 引入平滑参数λ以平衡梯度流动并稳定训练过程中的优化。
  • 模型使用类似Siamese的主干网络提取深层视频特征,随后通过TAM模块进行分类。
  • 最终预测通过计算每个类别所有支持代理中的最小对齐得分得出。
  • 框架通过元学习目标端到端训练,以优化少样本泛化能力。

实验结果

研究问题

  • RQ1显式建模时间顺序是否能提升少样本视频分类性能?
  • RQ2自适应时间对齐与固定或启发式对齐策略相比,在少样本视频学习中表现如何?
  • RQ3连续松弛在实现时间对齐模块的有效端到端训练方面能发挥多大作用?
  • RQ4该模型对视频序列中的非线性时间变化具有多强的鲁棒性?
  • RQ5所提出方法在视觉复杂度多样的不同视频数据集上是否具有良好的泛化能力?

主要发现

  • 在1-shot设置下,TAM在Kinetics数据集上达到73.0%的top-1准确率,在Something-Something-V2数据集上达到85.8%,相比均值池化基线模型提升约8%。
  • 在5-shot设置下,TAM在Something-Something-V2数据集上达到85.8%的top-1准确率,显著超过次优基线模型。
  • 消融实验表明,与Min、Mean和Diagonal等基线相比,TAM通过自适应对齐在1-shot和5-shot设置下性能均提升超过3%。
  • 模型对平滑参数λ的选择具有鲁棒性,在两个数据集上最优性能均出现在[0.05, 0.1]范围内。
  • 定性分析证实,TAM以端到端方式学习到查询视频与支持视频之间有意义且时间连贯的对齐路径。
  • 连续松弛技术实现了对齐路径的高效反向传播,使少样本学习目标可直接优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。