Skip to main content
QUICK REVIEW

[论文解读] Turbo Training with Token Dropout

Tengda Han, Weidi Xie|arXiv (Cornell University)|Oct 10, 2022
Adversarial Robustness in Machine Learning被引用 4
一句话总结

该论文提出Turbo训练,一种计算高效的视觉Transformer视频任务训练范式,通过联合优化掩码自编码损失和下游任务损失,利用稀疏采样的视觉token实现。该方法在保持动作分类、视频-语言学习和长视频动作识别等任务上具有竞争力的性能的同时,实现近4倍的训练加速和内存使用减少,使此前无法实现的端到端长视频训练成为可能。

ABSTRACT

The objective of this paper is an efficient training method for video tasks. We make three contributions: (1) We propose Turbo training, a simple and versatile training paradigm for Transformers on multiple video tasks. (2) We illustrate the advantages of Turbo training on action classification, video-language representation learning, and long-video activity classification, showing that Turbo training can largely maintain competitive performance while achieving almost 4X speed-up and significantly less memory consumption. (3) Turbo training enables long-schedule video-language training and end-to-end long-video training, delivering competitive or superior performance than previous works, which were infeasible to train under limited resources.

研究动机与目标

  • 解决在长视频数据上训练视觉Transformer所面临的高计算和内存成本问题,该问题阻碍了研究进展并限制了可及性。
  • 克服视频理解中长期训练周期和资源需求带来的瓶颈,尤其针对硬件资源有限的研究人员。
  • 通过减少对预提取特征或两阶段训练流程的依赖,实现视觉Transformer在长视频上的端到端训练。
  • 利用视频数据中的冗余性,在显著减少训练过程中处理的token数量的同时保持性能。
  • 证明通过掩码自编码和下游任务优化联合预训练,可在计算开销极小的情况下获得强大的表示能力。

提出的方法

  • 在训练过程中应用稀疏token丢弃,其中高达90%的时空token被掩码,并通过掩码自编码器重建。
  • 采用多任务目标进行端到端训练:使用掩码自编码损失进行自监督表示学习,同时使用标准下游损失(如交叉熵或对比损失)。
  • 每轮训练采用固定的掩码比例,帧采样限制在视频的前20%和后20%,以确保关键时刻的覆盖。
  • 通过调整掩码比例,使不同输入长度(如16、32、64帧)下可见patch的数量保持一致,以平衡计算成本和时间上下文。
  • 在单一优化循环中,同时使用掩码自编码和下游任务监督训练视觉Transformer编码器,实现联合特征学习。
  • 利用视频数据中固有的冗余性——仅需稀疏子集的token即可重建完整信号——实现在不降低性能的前提下高效训练。

实验结果

研究问题

  • RQ1将掩码自编码目标与下游任务监督结合,是否能在显著降低计算成本的同时,保持在视频理解任务上的竞争力?
  • RQ2在动作分类和视频-语言对齐等长视频任务中,token丢弃(如87.5%掩码)在多大程度上能保持表示质量?
  • RQ3Turbo训练能否实现视觉Transformer在长视频上的端到端训练,从而避免依赖预提取特征的两阶段流水线?
  • RQ4当使用不同掩码比例时,输入的时间跨度(如16帧 vs. 64帧)如何影响性能?
  • RQ5通过Turbo训练实现的联合视频-语言预训练,是否能产生优于依赖预提取特征或独立预训练阶段方法的高质量表示?

主要发现

  • Turbo训练在多个视频任务上实现了近4倍的训练速度提升和显著的内存减少,同时保持了具有竞争力的性能。
  • 在Breakfast数据集上,使用32帧输入和75%掩码比例(F32)的Turbo训练达到91.3%的准确率,优于使用预提取特征的两阶段方法(89.9%)。
  • 在COIN数据集上,Turbo训练使用32帧输入达到87.5%的准确率,与采用两阶段训练流水线的最先进方法(88.9%)相当。
  • 该方法实现了长视频的端到端训练,例如在HTM-AA数据集上,其在视频-语言对齐任务中表现优于以往方法(MIL-NCE: 31.3,IP: 22.0)。
  • 将帧数从16增加到32提升了性能(Breakfast数据集上从88.2%提升至91.3%),但进一步增加到64帧(87.5%掩码)后性能下降,表明高掩码比例可能遗漏关键动作。
  • 通过Turbo训练实现的联合视频-语言预训练产生了高质量嵌入,在TAN基准上达到49.4%的对齐准确率,优于依赖预提取特征的方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。