Skip to main content
QUICK REVIEW

[论文解读] Beyond Transfer Learning: Co-finetuning for Action Localisation

Anurag Arnab, Xuehan Xiong|arXiv (Cornell University)|Jul 8, 2022
Human Pose and Action Recognition被引用 4
一句话总结

本文提出协同微调(co-finetuning),一种训练策略,通过同时在多个上游视频分类数据集和一个下游动作定位任务(AVA/AVA-Kinetics)上微调单一模型,利用跨数据集特征迁移和正则化,显著提升性能,尤其在罕见类别上表现更优。该方法实现了最先进(SOTA)结果,在AVA上达到36.1 mAP,在AVA-Kinetics上达到36.2 mAP,优于采用传统迁移学习的复杂模型架构。

ABSTRACT

Transfer learning is the predominant paradigm for training deep networks on small target datasets. Models are typically pretrained on large ``upstream'' datasets for classification, as such labels are easy to collect, and then finetuned on ``downstream'' tasks such as action localisation, which are smaller due to their finer-grained annotations. In this paper, we question this approach, and propose co-finetuning -- simultaneously training a single model on multiple ``upstream'' and ``downstream'' tasks. We demonstrate that co-finetuning outperforms traditional transfer learning when using the same total amount of data, and also show how we can easily extend our approach to multiple ``upstream'' datasets to further improve performance. In particular, co-finetuning significantly improves the performance on rare classes in our downstream task, as it has a regularising effect, and enables the network to learn feature representations that transfer between different datasets. Finally, we observe how co-finetuning with public, video classification datasets, we are able to achieve state-of-the-art results for spatio-temporal action localisation on the challenging AVA and AVA-Kinetics datasets, outperforming recent works which develop intricate models.

研究动机与目标

  • 为解决传统迁移学习在动作定位中的局限性,即模型在单一上游数据集上预训练后在下游任务上微调。
  • 提升在长尾动作定位数据集(如AVA和AVA-Kinetics)上的性能,特别是针对易过拟合的罕见类别。
  • 探究在多个上游分类数据集上联合训练是否能对模型起到正则化作用,并提升特征迁移至下游检测任务的效果。
  • 证明仅通过修改训练策略的简单模型,可超越依赖外部记忆或图神经网络建模的复杂架构。
  • 评估不同上游数据集(如Kinetics、Moments in Time、SSv2、Instagram)在协同微调中用于动作定位时的有效性。

提出的方法

  • 协同微调同时在多个上游视频分类数据集(如Kinetics、Moments in Time、Something-Something V2)和一个下游动作定位数据集(AVA或AVA-Kinetics)上训练单一模型。
  • 训练目标结合了来自上游数据集的分类损失与来自下游数据集的检测损失,使用共享主干网络和任务特定头。
  • 该方法利用多个上游数据集更大的规模和多样性来正则化模型,尤其有利于下游数据集中罕见类别的表现。
  • 该方法采用标准检测架构(如ViViT),不引入复杂组件(如外部记忆或图神经网络),仅依赖训练策略本身。
  • 使用大规模数据集(如WTS,6000万视频)进行预训练,以进一步提升性能,且协同微调从训练初期即应用。
  • 推理仅在单视角上进行,空间分辨率提升(如512px)以提高精度,与图像检测实践保持一致。

实验结果

研究问题

  • RQ1与传统迁移学习相比,是否在多个上游视频分类数据集上联合训练能提升下游动作定位任务的性能?
  • RQ2协同微调是否具有正则化效应,尤其对AVA等长尾数据集中罕见类别有显著提升?
  • RQ3上游数据集的选择(如Kinetics vs. Moments in Time vs. SSv2)如何影响协同微调中的下游性能?
  • RQ4能否通过使用公开的、弱监督的视频数据集进行协同微调,在不依赖复杂模型架构的前提下实现最先进结果?
  • RQ5从分类任务中学习到的特征表示,能在多大程度上传递给动作定位中更复杂的检测任务?

主要发现

  • 使用Kinetics、Moments in Time和Something-Something V2进行协同微调,将AVA上的mAP提升至36.1,达到最先进性能。
  • 该方法在AVA-Kinetics上实现了36.2 mAP,为该基准的最先进结果。
  • 在罕见类别(Tail和Mid)上观察到显著提升,协同微调起到了正则化作用,有效减少过拟合。
  • 在协同微调中引入WTS预训练(6000万视频)进一步提升性能,相比基线mAP提高0.9%。
  • 尽管Kinetics是标准选择,但发现Moments in Time作为上游数据集在动作定位任务中比Kinetics更有效。
  • 该模型可同时执行视频分类和动作定位,在上游分类基准上也取得了具有竞争力的准确率。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。