Skip to main content
QUICK REVIEW

[论文解读] TTAN: Two-Stage Temporal Alignment Network for Few-shot Action Recognition.

Shuyuan Li, Huabin Liu|arXiv (Cornell University)|Jul 10, 2021
Human Pose and Action Recognition参考文献 30被引用 6
一句话总结

该论文提出TTAN,一种用于少样本动作识别的两阶段时间对齐网络,通过仿射时间变换与交叉注意力特征协调来解决时间错位问题。该方法通过建模动作时长与运动演化错位,结合新颖的多样本融合策略,在基准数据集上实现了最先进性能。

ABSTRACT

Few-shot action recognition aims to recognize novel action classes (query) using just a few samples (support). The majority of current approaches follow the metric learning paradigm, which learns to compare the similarity between videos. Recently, it has been observed that directly measuring this similarity is not ideal since different action instances may show distinctive temporal distribution, resulting in severe misalignment issues across query and support videos. In this paper, we arrest this problem from two distinct aspects -- action duration misalignment and motion evolution misalignment. We address them sequentially through a Two-stage Temporal Alignment Network (TTAN). The first stage performs temporal transformation with the predicted affine warp parameters, while the second stage utilizes a cross-attention mechanism to coordinate the features of the support and query to a consistent evolution. Besides, we devise a novel multi-shot fusion strategy, which takes the misalignment among support samples into consideration. Ablation studies and visualizations demonstrate the role played by both stages in addressing the misalignment. Extensive experiments on benchmark datasets show the potential of the proposed method in achieving state-of-the-art performance for few-shot action recognition.

研究动机与目标

  • 解决少样本动作识别中的时间错位挑战,其中查询视频与支持视频在动作时长与运动演化上存在不一致。
  • 克服度量学习方法的局限性,后者直接比较视频特征而未考虑时间分布差异。
  • 设计一个两阶段框架,按顺序校正动作时长效准与运动演化错位,以提升特征一致性。
  • 提出一种多样本融合策略,显式建模多个支持样本之间的错位,以增强识别鲁棒性。
  • 通过改进的时间对齐与特征协调,在标准少样本动作识别基准上实现最先进性能。

提出的方法

  • 在第一阶段应用仿射形变参数,对查询视频进行时间重标度,使其与支持视频对齐,以纠正动作时长效准。
  • 在第二阶段使用交叉注意力机制,基于时间演化模式动态对齐支持与查询视频之间的特征。
  • 集成交叉注意力模块,通过关注查询与支持模态间对应的时间片段,以优化特征表示。
  • 设计一种多样本融合策略,在聚合多个支持样本特征的同时,建模样本间错位,以提升泛化能力。
  • 采用对比损失端到端训练网络,以优化匹配查询与支持对之间的特征相似性。
  • 利用预训练视频主干网络(如I3D)提取初始特征,再应用两阶段对齐机制。

实验结果

研究问题

  • RQ1查询与支持视频之间的时间错位在多大程度上影响少样本动作识别性能?
  • RQ2仿射时间变换在多大程度上可减少少样本视频识别中的动作时长效准?
  • RQ3交叉注意力机制能否有效对齐查询与支持视频之间的运动演化模式?
  • RQ4对多个支持样本之间错位的建模在多大程度上提升识别准确率?
  • RQ5所提出的两阶段对齐框架是否在少样本动作识别基准上优于现有基于度量学习的方法?

主要发现

  • TTAN在标准少样本动作识别基准上实现最先进性能,展现出在新型动作类别上的卓越泛化能力。
  • 消融实验证实,TTAN的两个阶段均对性能有显著贡献,其中第二阶段(交叉注意力)贡献最大。
  • 多样本融合策略通过在特征聚合过程中有效建模支持样本间的错位,提升了识别准确率。
  • 可视化结果表明,交叉注意力机制成功对齐了查询与支持视频之间的判别性时间片段。
  • 两阶段对齐框架显著减少了特征错位,尤其在动作时长与运动动态差异较大的情况下表现更优。
  • TTAN优于现有基于度量学习的方法,尤其在仅有一个或少数支持样本的少样本设置下表现更佳。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。