[论文解读] Unsupervised Pre-training for Temporal Action Localization Tasks
本文提出伪动作定位(Pseudo Action Localization, PAL),一种新颖的自监督掩蔽任务,用于为时间动作定位(TAL)量身定制的视频特征编码器无监督预训练。通过随机裁剪时间区域作为伪动作,并将其粘贴到不同背景视频中,PAL 通过对比学习强制实现时间等变性,显著提升了现有无监督和有监督预训练方法在下游 TAL 任务中的性能。
Unsupervised video representation learning has made remarkable achievements in recent years. However, most existing methods are designed and optimized for video classification. These pre-trained models can be sub-optimal for temporal localization tasks due to the inherent discrepancy between video-level classification and clip-level localization. To bridge this gap, we make the first attempt to propose a self-supervised pretext task, coined as Pseudo Action Localization (PAL) to Unsupervisedly Pre-train feature encoders for Temporal Action Localization tasks (UP-TAL). Specifically, we first randomly select temporal regions, each of which contains multiple clips, from one video as pseudo actions and then paste them onto different temporal positions of the other two videos. The pretext task is to align the features of pasted pseudo action regions from two synthetic videos and maximize the agreement between them. Compared to the existing unsupervised video representation learning approaches, our PAL adapts better to downstream TAL tasks by introducing a temporal equivariant contrastive learning paradigm in a temporally dense and scale-aware manner. Extensive experiments show that PAL can utilize large-scale unlabeled video data to significantly boost the performance of existing TAL methods. Our codes and models will be made publicly available at https://github.com/zhang-can/UP-TAL.
研究动机与目标
- 为解决视频分类(TAC)与时间动作定位(TAL)之间的性能差距,设计一种更契合 TAL 需求的预训练方法。
- 克服现有无监督视频表示学习的局限性,其聚焦于视频级别的实例判别,却无法捕捉定位任务所需的时序等变性。
- 通过引入一种模拟真实 TAL 任务中固有的时间边界检测以及尺度/速度变化的掩蔽任务,实现对大规模未标注视频数据在 TAL 中的有效利用。
- 通过强调判别性动作部分并最小化背景干扰,构建一种增强特征鲁棒性与边界感知能力的预训练范式。
提出的方法
- 通过从视频中随机裁剪多个连续片段(时间长度和尺度可变)构建伪动作区域。
- 将这些伪动作粘贴到另外两个背景视频的不同时间位置,生成合成训练样本对。
- 应用时间等变对比学习目标,对齐两个合成视频中同一伪动作的特征,强制其在时间变换下保持一致性。
- 使用多层时间卷积网络处理片段级特征,增强上下文感知能力,提升定位任务的特征表示能力。
- 最大化两个合成视频中粘贴的伪动作区域特征的一致性,以鼓励模型聚焦于判别性、与背景无关的动作成分。
- 设计掩蔽任务以促进时间平移与尺度等变性,确保特征能适应动作起始时间与持续时间的变化。
实验结果
研究问题
- RQ1能否设计一种自监督掩蔽任务,使其预训练表示更契合时间动作定位(TAL)的需求,而不仅限于视频级分类?
- RQ2通过对比学习框架强制实现时间等变性,是否能相比标准实例判别方法,显著提升定位任务的特征质量?
- RQ3当在 ActivityNet 和 THUMOS 等下游 TAL 基准上进行微调时,所提出的伪动作定位(PAL)掩蔽任务表现如何?
- RQ4PAL 在小样本数据集上泛化能力如何?其表示能力能否迁移到其他视频理解任务(如动作分类)?
- RQ5所学习的特征是否表现出时间等变行为,即动作的时间变换是否能在特征空间中被准确反映?
主要发现
- 在 ActivityNet v1.3 上,PAL 在时间动作检测任务中将 mAP@AVG 提升了 2.2%(相比 MoCo-v2)和 1.2%(相比 TAC 预训练基线)。
- 在小样本的 THUMOS’14 数据集上,PAL 实现了 10.9% 的相对 mAP@0.7 提升,表明其在低数据场景下具有强大的泛化能力。
- 在 UCF101 和 HMDB51 上,PAL 分别在动作分类任务的 top-1 准确率上超越 SOTA 的 MoCo-v2 基线 +2.7% 和 +3.1%。
- 特征可视化结果表明,PAL 学习到了时间等变特征:在时间变换下,动作片段之间的相似性变化具有可预测性,而时间不变的基线则不具备此特性。
- 该方法增强了边界感知能力,并提升了动作与背景片段之间的特征对比度,从而生成更清晰、更具信息量的特征表示。
- 所提方法在 TAL 之外也表现出良好泛化能力,在动作分类任务上表现具有竞争力,表明所学表示具备广泛的迁移能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。