Skip to main content
QUICK REVIEW

[论文解读] A Closer Look at Few-Shot Video Classification: A New Baseline and Benchmark

Zhenxi Zhu, Limin Wang|arXiv (Cornell University)|Oct 24, 2021
Human Pose and Action Recognition参考文献 26被引用 14
一句话总结

本文提出了一种基于分类器的简单基线方法,结合权重印记与dropout,在少样本视频分类任务中超越了当前最先进(SOTA)的元学习方法,揭示出表征学习——而非复杂的时序对齐——才是关键瓶颈。此外,本文还引入了一个新的基准数据集complete-Kinetics,通过扩展基础数据以支持无需预训练的训练,表明当数据量充足时性能可显著提升。

ABSTRACT

The existing few-shot video classification methods often employ a meta-learning paradigm by designing customized temporal alignment module for similarity calculation. While significant progress has been made, these methods fail to focus on learning effective representations, and heavily rely on the ImageNet pre-training, which might be unreasonable for the few-shot recognition setting due to semantics overlap. In this paper, we aim to present an in-depth study on few-shot video classification by making three contributions. First, we perform a consistent comparative study on the existing metric-based methods to figure out their limitations in representation learning. Accordingly, we propose a simple classifier-based baseline without any temporal alignment that surprisingly outperforms the state-of-the-art meta-learning based methods. Second, we discover that there is a high correlation between the novel action class and the ImageNet object class, which is problematic in the few-shot recognition setting. Our results show that the performance of training from scratch drops significantly, which implies that the existing benchmarks cannot provide enough base data. Finally, we present a new benchmark with more base data to facilitate future few-shot video classification without pre-training. The code will be made available at https://github.com/MCG-NJU/FSL-Video.

研究动机与目标

  • 通过分析现有元学习方法对时序对齐和预训练的依赖,重新评估其在少样本视频分类任务中的有效性。
  • 探究在ImageNet上进行预训练是否因与新类别存在语义重叠而破坏少样本学习的假设。
  • 通过增加更多训练样本,解决当前基准中基础数据不足的问题,提出一个新的基准。
  • 建立一个强大且简单的基线方法,其性能超越复杂的元学习方法,凸显表征学习相较于架构复杂度的重要性。

提出的方法

  • 提出一种基于分类器的基线方法,采用线性分类器结合权重印记与dropout,通过标准的预训练与微调方式训练,不使用元学习或时序对齐机制。
  • 在多种具有不同时序对齐机制的元学习方法之间进行公平比较,以隔离表征学习的影响。
  • 在Kinetics数据集上评估监督式与自监督式预训练(如MoCo)的效果,以评估预训练在性能提升中的作用。
  • 通过使用原始Kinetics数据集中全部训练样本(共49,325个视频)构建新的complete-Kinetics基准,同时保留原始的验证集与测试集划分。
  • 在所有方法中采用一致的训练与评估协议,以确保公平比较,尤其是在零样本与少样本设置下。
  • 分析ImageNet中的物体类别与新动作类别之间的相关性,以量化在少样本评估中因预训练数据泄露带来的风险。

实验结果

研究问题

  • RQ1为何尽管采用了复杂的时序对齐模块,基于元学习的少样本视频分类方法仍表现不佳?
  • RQ2ImageNet预训练在多大程度上因与新动作类别的语义重叠而造成性能偏差?
  • RQ3能否通过一种简单的基于分类器的方法超越当前最先进(SOTA)的元学习方法?
  • RQ4当不使用预训练时,基础训练数据的可用性对性能有多大影响?
  • RQ5少样本视频分类的真正瓶颈是时序建模,还是表征学习?

主要发现

  • 所提出的基于分类器的基线方法(结合权重印记与dropout)在标准Kinetics少样本基准上超越了所有当前最先进(SOTA)的元学习方法。
  • 在现有基准上从零开始训练时性能显著下降,表明基础数据不足,难以实现有效的表征学习。
  • 在ImageNet上进行预训练带来的性能提升并非仅因特征质量,更因与新动作类别的语义重叠,违反了少样本学习的假设。
  • 自监督预训练(如MoCo)仍能显著提升从零开始训练的性能,证实表征学习仍是核心挑战。
  • 在新的complete-Kinetics基准上,基线方法在无需预训练的情况下实现了显著性能提升,而元学习方法仅获得微小改进。
  • 当进行公平比较时,元学习方法与简单基线之间的性能差距缩小,表明表征学习是主导因素,而非模型架构的复杂度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。