Skip to main content
QUICK REVIEW

[论文解读] A3D: Adaptive 3D Networks for Video Action Recognition

Sijie Zhu, Taojiannan Yang|arXiv (Cornell University)|Nov 24, 2020
Human Pose and Action Recognition参考文献 46被引用 10
一句话总结

A3D 引入了一个单一的自适应 3D 网络,通过联合训练多种空间-时间-宽度配置,在推理时动态适应不同的计算约束。通过空间-时间蒸馏,它实现了不同配置之间的知识迁移,在相同预算下,尤其在 Kinetics-400 的低计算设置下,其准确率优于独立训练的模型。

ABSTRACT

This paper presents A3D, an adaptive 3D network that can infer at a wide range of computational constraints with one-time training. Instead of training multiple models in a grid-search manner, it generates good configurations by trading off between network width and spatio-temporal resolution. Furthermore, the computation cost can be adapted after the model is deployed to meet variable constraints, for example, on edge devices. Even under the same computational constraints, the performance of our adaptive networks can be significantly boosted over the baseline counterparts by the mutual training along three dimensions. When a multiple pathway framework, e.g. SlowFast, is adopted, our adaptive method encourages a better trade-off between pathways than manual designs. Extensive experiments on the Kinetics dataset show the effectiveness of the proposed framework. The performance gain is also verified to transfer well between datasets and tasks. Code will be made available.

研究动机与目标

  • 解决在计算资源有限的边缘设备上部署 3D 视频动作识别模型时,计算预算波动带来的挑战。
  • 消除为不同计算约束而训练和部署多个独立模型的需求。
  • 通过多尺度训练实现相互知识学习,提升所有配置下的模型性能。
  • 实现在推理时无需微调的动态自适应,支持边缘设备上的实时部署。
  • 证明所学表征在下游任务中的可迁移性以及跨数据集的泛化能力。

提出的方法

  • 在每次训练迭代中,通过随机采样不同的输入空间分辨率、时间长度和网络宽度组合来训练单一的 A3D 模型。
  • 引入空间-时间蒸馏(STD),将高分辨率配置的知识迁移至低分辨率配置,提升跨尺度的特征学习能力。
  • 保持全分辨率网络作为主干分支,同时将其表征蒸馏到输入空间和时间更小的子网络中。
  • 将该框架应用于多种架构(包括 SlowFast),在无需手动设计的情况下提升路径间权衡。
  • 采用统一的训练范式,支持跨配置的端到端优化,相比网格搜索方法显著降低训练成本。
  • 支持从同一模型运行时推理任意配置,实现对硬件约束变化的动态适应。

实验结果

研究问题

  • RQ1一个单一的 3D 视频识别模型是否能在不重新训练的情况下,有效实现广泛计算预算下的准确率-效率权衡?
  • RQ2与独立训练每个配置相比,通过多种空间-时间-宽度配置进行联合训练是否能提升性能?
  • RQ3在不同分辨率之间进行知识蒸馏是否能增强低计算量配置中的特征表示?
  • RQ4在准确率、效率和部署灵活性方面,A3D 与现有方法(如 X3D 和 SlowFast)相比表现如何?
  • RQ5A3D 所学表征在其他数据集和任务(如动作检测)上的泛化程度如何?

主要发现

  • 在与 SlowFast-4×16 相同的 36.1 GFLOPs × 30 视图约束下,A3D 在 Kinetics-400 上实现了 75.7% 的 top-1 准确率,优于基线模型 SlowFast-4×16-P(75.6%)和独立训练的 A3D-Slow-8×8-[0.06,1](75.6%)的相同配置。
  • 在低计算设置下(例如原始计算量的 0.35×),A3D-SlowFast-4×16-[0.06,1] 在仅 12.4 GFLOPs × 30 视图下实现了 74.3% 的 top-1 准确率,显著优于相同计算水平下的复现模型 SlowFast-2×32-P(73.5%)。
  • 当计算量为 0.6× 时(21.3 GFLOPs × 30 视图),A3D-SlowFast-4×16-[0.06,1] 保持 75.0% 的 top-1 准确率,而基线模型 SlowFast-2×32-P 在相同约束下下降至 73.5%。
  • A3D-Slow-8×8-[0.06,1] 在相同配置下实现了 75.6% 的 top-1 准确率,优于独立训练的 Slow-8×8-P(74.8%)和多分辨率基线模型(73.4%)。
  • 在计算量较低的场景下,相互训练与蒸馏带来的性能增益尤为显著,A3D 相较于独立训练模型最高可提升 1.1% 的准确率。
  • 在 Charade-STA 和 AVA 数据集上的迁移结果表明,A3D 所学表征在不同数据集和任务间具有良好的泛化能力,验证了所学特征的鲁棒性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。