Skip to main content
QUICK REVIEW

[论文解读] FROSTER: Frozen CLIP Is A Strong Teacher for Open-Vocabulary Action Recognition

Xiaohu Huang, Hao Zhou|arXiv (Cornell University)|Feb 5, 2024
Natural Language Processing Techniques被引用 4
一句话总结

FROSTER 提出了一种知识蒸馏框架,使用冻结的 CLIP 模型作为教师模型,在保持泛化能力的同时,实现视频特定特征学习,以支持开放词汇动作识别。通过应用残差特征蒸馏,FROSTER 在多个基准测试中实现了最先进性能,尤其在需要强泛化能力的分布外数据集上表现突出。

ABSTRACT

In this paper, we introduce FROSTER, an effective framework for open-vocabulary action recognition. The CLIP model has achieved remarkable success in a range of image-based tasks, benefiting from its strong generalization capability stemming from pretaining on massive image-text pairs. However, applying CLIP directly to the open-vocabulary action recognition task is challenging due to the absence of temporal information in CLIP's pretraining. Further, fine-tuning CLIP on action recognition datasets may lead to overfitting and hinder its generalizability, resulting in unsatisfactory results when dealing with unseen actions. To address these issues, FROSTER employs a residual feature distillation approach to ensure that CLIP retains its generalization capability while effectively adapting to the action recognition task. Specifically, the residual feature distillation treats the frozen CLIP model as a teacher to maintain the generalizability exhibited by the original CLIP and supervises the feature learning for the extraction of video-specific features to bridge the gap between images and videos. Meanwhile, it uses a residual sub-network for feature distillation to reach a balance between the two distinct objectives of learning generalizable and video-specific features. We extensively evaluate FROSTER on open-vocabulary action recognition benchmarks under both base-to-novel and cross-dataset settings. FROSTER consistently achieves state-of-the-art performance on all datasets across the board. Project page: https://visual-ai.github.io/froster.

研究动机与目标

  • 解决微调后的 CLIP 模型在开放词汇动作识别中泛化能力差的问题,尤其是在未见或语义上相距较远的动作类别上。
  • 通过在图像预训练的 CLIP 与视频动作识别之间建立桥梁,缓解领域差距,实现在不牺牲 CLIP 强大泛化能力的前提下进行视频特定特征学习。
  • 开发一种轻量化、高效的框架,整合冻结 CLIP 与视频特定学生模型的知识,避免模型集成带来的计算开销。
  • 确保与多种网络架构的兼容性,包括完全微调和适配器方法模型,以最大化实际适用性。

提出的方法

  • 训练期间冻结 CLIP 的视觉和文本编码器,将其作为知识蒸馏教师模型,以保留可泛化的表征。
  • 引入残差特征蒸馏:学生模型学习预测冻结 CLIP 特征与自身特征之间的残差,从而实现视频特定特征与可泛化特征的联合优化。
  • 使用残差子网络解耦视频特定特征学习(通过微调)与可泛化特征学习(通过蒸馏),以平衡双重目标。
  • 在视觉和文本特征上均应用蒸馏,采用无投影器设计,以避免泛化能力下降。
  • 引入文本增强(如类别名称扩充)以提升文本泛化能力,增强零样本迁移性能。
  • 在推理阶段通过特征级集成将学生模型与冻结 CLIP 联合,以验证知识蒸馏的有效性,但最终模型仍作为单一学生模型运行。

实验结果

研究问题

  • RQ1冻结的 CLIP 模型能否作为有效的知识蒸馏教师模型,在不微调的情况下提升视频动作识别的泛化能力?
  • RQ2残差特征蒸馏是否能有效平衡视频特定特征学习与保留 CLIP 泛化能力?
  • RQ3FROSTER 在开放词汇基准测试中的表现如何,特别是在与训练集语义相似度较低的数据集上?
  • RQ4当泛化需求增加时(如在 Kinetics-600 上对比 UCF-101 或 HMDB-51),FROSTER 的性能增益是否随之提升?
  • RQ5FROSTER 是否能有效应用于不同模型架构,包括完全微调和适配器方法模型?

主要发现

  • FROSTER 在所有评估基准上均达到最先进性能,包括在 base-to-novel 设置下于 Kinetics-600 上实现 85.0% 的 top-1 准确率,甚至优于集成方法。
  • 在与 Kinetics-400 语义距离最远(Hausdorff 距离最大)的 Kinetics-600 上,FROSTER 实现了最大的相对性能提升,证实其在高泛化需求场景下的有效性。
  • 残差特征蒸馏优于标准蒸馏和基于投影器的蒸馏,在结合文本增强后,于 Kinetics-600 上达到 74.8% 的 top-1 准确率。
  • 该方法在所有数据集上均提升性能,其中在 K-600 上提升最大(相对于基线提升约 7.5%),表明其具有显著的泛化增强能力。
  • FROSTER 在不同架构上均有效:其在完全微调和适配器模型上均带来性能提升,且在前者上增益更大,归因于其更高的参数容量。
  • 注意力可视化结果表明,FROSTER 关注运动物体(如手)和相关背景线索(如水槽、桌子),而冻结 CLIP 关注背景,微调模型可能忽略关键运动线索。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。