Skip to main content
QUICK REVIEW

[论文解读] Few-Shot Temporal Action Localization with Query Adaptive Transformer

Sauradip Nag, Xiatian Zhu|arXiv (Cornell University)|Oct 20, 2021
Human Pose and Action Recognition被引用 4
一句话总结

本文提出了一种新颖的少样本时序动作定位(FS-TAL)设定,利用未剪辑的支持视频以提升上下文理解能力与模型泛化性能。提出了一种查询自适应Transformer(QAT),可动态适应每个查询视频的基分类器,在ActivityNet与THUMOS数据集上,无论是在单领域还是跨领域场景下,1/5-shot设置下的mAP@0.5均显著优于先前方法4.8–6.2个百分点。

ABSTRACT

Existing temporal action localization (TAL) works rely on a large number of training videos with exhaustive segment-level annotation, preventing them from scaling to new classes. As a solution to this problem, few-shot TAL (FS-TAL) aims to adapt a model to a new class represented by as few as a single video. Exiting FS-TAL methods assume trimmed training videos for new classes. However, this setting is not only unnatural actions are typically captured in untrimmed videos, but also ignores background video segments containing vital contextual cues for foreground action segmentation. In this work, we first propose a new FS-TAL setting by proposing to use untrimmed training videos. Further, a novel FS-TAL model is proposed which maximizes the knowledge transfer from training classes whilst enabling the model to be dynamically adapted to both the new class and each video of that class simultaneously. This is achieved by introducing a query adaptive Transformer in the model. Extensive experiments on two action localization benchmarks demonstrate that our method can outperform all the state of the art alternatives significantly in both single-domain and cross-domain scenarios. The source code can be found in https://github.com/sauradip/fewshotQAT

研究动机与目标

  • 为解决现有少样本TAL方法依赖剪辑视频所带来的局限性,后者会丢弃宝贵的背景上下文信息。
  • 提出一种更贴近实际应用的FS-TAL设定,其中新类别由带有时间标注的未剪辑视频表示。
  • 实现对前景/背景分类器的动态适应,使其同时适配新类别与每个独立的查询视频。
  • 通过利用未剪辑视频中的上下文线索,提升从已见类别到未见类别的知识迁移能力。
  • 开发一种查询自适应Transformer机制,以在低样本条件下增强类内不变性建模。

提出的方法

  • 提出一种新的FS-TAL设定,其中支持集由带有完整时间标注的未剪辑视频构成,以保留背景上下文信息。
  • 设计一种查询自适应Transformer(QAT),输入为查询视频特征与分类器权重,生成针对特定视频的分类器自适应参数。
  • 使用支持集上训练的片段级二分类器,以区分前景与背景片段。
  • 采用元学习训练QAT模块,使其能够在新类别上实现良好泛化,并在推理阶段实现快速适应。
  • 将QAT模块与视频嵌入网络(如GTAD或BMN)集成,以从未剪辑视频中提取上下文特征。
  • 支持剪辑与未剪辑两种设定,实现与现有基准的向后兼容。

实验结果

研究问题

  • RQ1当使用未剪辑支持视频而非剪辑视频进行训练时,少样本TAL模型是否能取得更优性能?
  • RQ2在少样本设定下,将未剪辑视频中的背景上下文信息纳入模型,是否能增强模型对类内差异的处理能力?
  • RQ3查询自适应Transformer机制是否能动态适应每个查询视频的基分类器,从而提升定位精度?
  • RQ4在从ActivityNet到THUMOS以及反向迁移时,所提方法在跨域场景下的泛化能力如何?
  • RQ5与先前SOTA方法相比,所提方法的计算效率如何?

主要发现

  • 在ActivityNet数据集上,该方法在1-shot设定下相比[Yang et al., 2020]实现了4.8%的mAP@0.5提升,在5-shot设定下提升了6.2%。
  • 在从ActivityNet到THUMOS的跨域迁移设定下,该方法在1-shot时达到45.9%的mAP@0.5,5-shot时达到54.4%,分别优于先前SOTA方法4.8和6.2个百分点。
  • 模型的推理速度与[Yang et al., 2020]相当,单次任务仅需0.83秒(在单张RTX2080Ti GPU上),表明无效率损失。
  • GTAD主干网络的深层(如layer-5)性能优于浅层,因成本效益更优,故选择layer-5作为最优嵌入层。
  • 消融实验表明,查询自适应Transformer显著提升了性能,尤其在处理多样化视频上下文中的类内差异方面表现突出。
  • 该方法在跨域场景下泛化能力良好,在ActivityNet→THUMOS与THUMOS→ActivityNet两个方向上均表现出一致的性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。