Skip to main content
QUICK REVIEW

[论文解读] Video + CLIP Baseline for Ego4D Long-term Action Anticipation

Srijan Das, Michael S. Ryoo|arXiv (Cornell University)|Jul 1, 2022
Human Pose and Action Recognition被引用 7
一句话总结

本论文通过融合预训练CLIP模型与Slowfast视频编码器的特征,提出了一种用于Ego4D数据集长期动作预测的视频+CLIP基线方法。通过使用交叉注意力机制,将文本提示的时序上下文聚合到CLIP嵌入中,该方法在验证集上实现了最先进性能,Z=20、K=5时,编辑距离达到0.7125(动词)和0.747(名词),优于原始基线模型。

ABSTRACT

In this report, we introduce our adaptation of image-text models for long-term action anticipation. Our Video + CLIP framework makes use of a large-scale pre-trained paired image-text model: CLIP and a video encoder Slowfast network. The CLIP embedding provides fine-grained understanding of objects relevant for an action whereas the slowfast network is responsible for modeling temporal information within a video clip of few frames. We show that the features obtained from both encoders are complementary to each other, thus outperforming the baseline on Ego4D for the task of long-term action anticipation. Our code is available at github.com/srijandas07/clip_baseline_LTA_Ego4d.

研究动机与目标

  • 通过利用CLIP等预训练图文模型,提升在第一人称视频中的长期动作预测性能。
  • 解决CLIP在动词预测中缺乏时序推理能力的问题,尽管其在帧级理解方面表现优异。
  • 探索CLIP的细粒度视觉理解与Slowfast的时序建模能力之间的互补性融合,以提升动作预测性能。
  • 验证基于注意力机制的CLIP特征聚合方式,相较于平均池化和简单拼接,能更有效地提升性能。

提出的方法

  • 使用未微调的预训练ViT-B/16编码器,从视频片段的每一帧中提取CLIP图像嵌入。
  • 通过CLIP的文本编码器,使用Ego4D数据集中顶词、动词、场景和地点的提示模板生成文本嵌入。
  • 采用多头交叉注意力机制融合CLIP图像与文本嵌入,其中文本提示作为查询,图像特征作为键和值。
  • 将CLIP注意力聚合后的描述符与Slowfast网络特征(2048 + 512维)拼接,形成片段级表示。
  • 使用6层Transformer聚合模块和解码器网络,遵循Ego4D基线框架进行序列预测。
  • 在8块A5000 GPU上端到端训练聚合头与解码器头,批量大小为64,训练30个周期,基础初始学习率为0.0001。

实验结果

研究问题

  • RQ1当与视频专用时序编码器融合时,预训练CLIP特征是否能提升长期动作预测性能?
  • RQ2基于注意力机制的CLIP特征时序聚合是否优于简单的平均池化方法?
  • RQ3鉴于CLIP缺乏时序建模能力,其在第一人称视频中预测动词与名词的效果如何?
  • RQ4将CLIP文本嵌入与图像特征拼接,是否能为图像特征本身带来额外增益?
  • RQ5CLIP + Slowfast混合架构是否能在长期动作预测中超越原始Ego4D基线?

主要发现

  • CLIP注意力变体在动词和名词上的编辑距离分别达到0.7125和0.747,优于原始基线(0.745, 0.779),表现最佳。
  • 仅使用CLIP图像特征的基线(L2)性能劣于原始基线,表明原始CLIP特征在动词预测中缺乏时序推理能力。
  • 在CLIP图像特征中加入CLIP文本特征(L3)并未提升性能,表明显式拼接文本特征无法带来互补增益。
  • CLIP注意力机制能有效根据文本提示加权相关帧,实现更优的时序聚合。
  • CLIP与Slowfast特征的融合提供了互补信息,其中CLIP增强了帧级理解,而Slowfast捕捉了运动模式。
  • 该方法在CVPR 2022 Ego4D长期动作预测挑战赛中排名第二,验证了其在测试集上的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。