[论文解读] FitCLIP: Refining Large-Scale Pretrained Image-Text Models for Zero-Shot Video Understanding Tasks
FitCLIP 提出了一种基于蒸馏的微调策略,用于将大规模预训练图像-文本模型(如 CLIP)适配至零样本视频理解任务。通过利用在标注数据和伪标签视频数据上训练的学生网络,并与教师模型(CLIP)通过权重空间集成相结合,FitCLIP 在多个基准上实现了零样本动作识别和文本到视频检索的最先进性能,且无需额外推理成本,显著优于 CLIP 的表现。
Large-scale pretrained image-text models have shown incredible zero-shot performance in a handful of tasks, including video ones such as action recognition and text-to-video retrieval. However, these models have not been adapted to video, mainly because they do not account for the time dimension but also because video frames are different from the typical images (e.g., containing motion blur, and less sharpness). In this paper, we present a fine-tuning strategy to refine these large-scale pretrained image-text models for zero-shot video understanding tasks. We show that by carefully adapting these models we obtain considerable improvements on two zero-shot Action Recognition tasks and three zero-shot Text-to-video Retrieval tasks. The code is available at https://github.com/bryant1410/fitclip
研究动机与目标
- 解决图像与视频数据之间的域差距,该差距限制了大规模图像-文本模型(如 CLIP)在视频任务中的零样本性能。
- 开发一种微调策略,在不牺牲原始模型鲁棒性或引入推理成本的前提下,提升零样本视频理解能力。
- 验证知识蒸馏与权重空间集成在将视频特定知识迁移至预训练图像-文本模型中的有效性。
- 利用多样化的视频数据集,建立零样本动作识别与文本到视频检索的新基准。
- 证明在视频数据上结合伪标签进行微调,可显著增强零样本能力,同时保持模型的泛化性能。
提出的方法
- FitCLIP 使用一个学生网络,在少量标注视频数据与大规模伪标签视频数据的组合上进行训练,以学习视频特定表征。
- 该方法从预训练的 CLIP 教师模型向学生模型进行知识蒸馏,对视频输入对齐视觉与文本特征。
- 其关键创新在于采用权重空间集成,将学生与教师模型的权重融合,生成一个结合通用图像知识与视频特定适应能力的最终模型。
- 学生网络被训练以同时预测真实标签与教师模型的 logits,从而在适应视频特有特征(如运动模糊与清晰度下降)的同时实现知识迁移。
- 该方法应用于两个主要任务:零样本动作识别与零样本文本到视频检索,使用多个基准数据集。
- 最终模型在推理时无需额外开销,因集成权重可直接使用。
实验结果
研究问题
- RQ1基于蒸馏的微调是否能提升图像-文本模型(如 CLIP)在视频理解任务上的零样本性能?
- RQ2权重空间集成是否有助于在引入学生网络的视频特定知识的同时,保持教师模型的鲁棒性?
- RQ3FitCLIP 在零样本动作识别与文本到视频检索基准上的性能,相较于 CLIP 及其他最先进模型如何?
- RQ4在大规模视频数据上进行伪标签训练,对零样本迁移至下游视频任务的提升程度如何?
- RQ5在不同视频数据分布(如第一视角、未剪辑、教学类)上进行训练,对最终零样本性能的影响如何?
主要发现
- FitCLIP 在零样本文本到视频检索任务上达到新的 SOTA,相较于 CLIP 在 DiDeMo 上提升 3.8%,在 MSR-VTT 上提升 4.7%,在 MiT 上提升 1.9%。
- 在零样本动作识别任务中,FitCLIP 将 CLIP 的准确率从 UCF101 上的 74.5% 提升至 73.3%,从 MiT 上的 19.9% 提升至 21.8%。
- 学生网络带来的性能增益在所有数据集上均保持一致,相较于教师模型提升范围为 0.9% 至 4.7%。
- 权重空间集成步骤至关重要:即使学生在不同数据上训练,该步骤仍能保持或提升教师模型在多样化数据集上的性能。
- 尽管是零样本方法,FitCLIP 在某些基准(如 YouCook2 上的 CAMoE)上仍优于多个有监督模型,但尚未超越最佳有监督方法。
- 该方法表明,通过蒸馏在大规模伪标签视频数据上进行微调,可有效弥合图像到视频的域差距,且不引入推理成本。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。