[论文解读] CAST: Cross-Attention in Space and Time for Video Action Recognition
CAST 提出了一种双流视频动作识别模型,通过空间专家网络与时间专家网络之间的交叉注意力机制,仅使用 RGB 输入即可实现平衡的时空理解。通过在瓶颈结构中实现协同信息交换,CAST 在多样化的数据集上实现了 77.9% 的最优调和平均准确率,其在静态偏向与时间偏向基准上的性能表现均优于现有方法。
Recognizing human actions in videos requires spatial and temporal understanding. Most existing action recognition models lack a balanced spatio-temporal understanding of videos. In this work, we propose a novel two-stream architecture, called Cross-Attention in Space and Time (CAST), that achieves a balanced spatio-temporal understanding of videos using only RGB input. Our proposed bottleneck cross-attention mechanism enables the spatial and temporal expert models to exchange information and make synergistic predictions, leading to improved performance. We validate the proposed method with extensive experiments on public benchmarks with different characteristics: EPIC-KITCHENS-100, Something-Something-V2, and Kinetics-400. Our method consistently shows favorable performance across these datasets, while the performance of existing methods fluctuates depending on the dataset characteristics.
研究动机与目标
- 解决现有视频动作识别模型中常见的时空理解不平衡问题。
- 在不依赖光流或多模态输入的前提下,提升在静态偏向与时间偏向数据集上的性能。
- 设计一种双流架构,使空间与时间专家通过交叉注意力协同预测动作。
- 验证瓶颈结构中的交叉注意力机制在实现平衡表征学习方面的有效性。
- 在具有不同特性的多样化视频动作识别基准上,展示一致的性能表现。
提出的方法
- 该模型采用两个专家网络:空间专家用于建模空间上下文,时间专家用于捕捉时间动态,两者均处理 RGB 视频片段。
- 在空间专家与时间专家之间应用交叉注意力机制,以实现双向信息交换与协同预测。
- 将交叉注意力机制置于瓶颈架构中,以增强特征精炼与学习效率。
- 最终预测结果为两个专家预测结果的加权组合,以充分利用其互补优势。
- 模型通过标准交叉熵损失在动作分类任务上进行端到端训练。
- 消融实验验证了两个专家流以及瓶颈交叉注意力设计的必要性。
实验结果
研究问题
- RQ1具有空间与时间专家之间交叉注意力的双流架构,是否能比单流模型实现更优的平衡时空理解?
- RQ2与标准注意力或早期融合相比,瓶颈结构中的交叉注意力机制是否能提升表征学习效果?
- RQ3所提出方法在具有不同偏向的数据集(如静态偏向的 Kinetics-400、时间偏向的 Something-So,以及细粒度的 EPIC-KITCHENS-100)上的表现如何?
- RQ4现有方法在不同数据集上的性能是否显著失衡?CAST 是否能缓解此问题?
- RQ5每个专家流与交叉注意力机制对整体性能的贡献分别是什么?
主要发现
- CAST 在 EK100、SSV2 和 K400 数据集上的调和平均准确率达到 77.9%,优于 AIM(75.4%)与 VideoMAE(75.8%)在相同指标下的表现。
- 在 K400 数据集上,CAST 达到 85.3% 的 top-1 准确率,超过 VideoMAE(81.5%),并达到该基准上最佳方法的水平。
- 在 SSV2 数据集上,CAST 达到 71.6% 的 top-1 准确率,超过 VideoMAE(70.8%),并在这一时间偏向基准上显著优于 AIM(68.1%)。
- 在细粒度的 EPIC-KITCHENS-100 数据集上,CAST 达到 49.3% 的动作准确率,在对比方法中排名第二。
- 消融实验确认,空间与时间专家均不可或缺,且瓶颈结构中的交叉注意力机制相比基线方法显著提升了性能。
- CAST 在所有数据集上均表现出一致且优异的性能,表明其相比现有方法具备更平衡的时空理解能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。