[论文解读] Bridge-Prompt: Towards Ordinal Action Understanding in Instructional Videos
Bridge-Prompt 提出了一种基于提示的框架,通过整合同时编码单个动作语义及其顺序关系的文本提示,建模教学视频中有序动作之间的语义关系。通过在这些结构化提示上联合训练视觉和文本编码器,并采用对比学习方法,该方法在 GTEA、50Salads 和 Breakfast 等动作分割与识别基准上实现了最先进性能,展现出更优的上下文理解能力与零样本迁移能力。
Action recognition models have shown a promising capability to classify human actions in short video clips. In a real scenario, multiple correlated human actions commonly occur in particular orders, forming semantically meaningful human activities. Conventional action recognition approaches focus on analyzing single actions. However, they fail to fully reason about the contextual relations between adjacent actions, which provide potential temporal logic for understanding long videos. In this paper, we propose a prompt-based framework, Bridge-Prompt (Br-Prompt), to model the semantics across adjacent actions, so that it simultaneously exploits both out-of-context and contextual information from a series of ordinal actions in instructional videos. More specifically, we reformulate the individual action labels as integrated text prompts for supervision, which bridge the gap between individual action semantics. The generated text prompts are paired with corresponding video clips, and together co-train the text encoder and the video encoder via a contrastive approach. The learned vision encoder has a stronger capability for ordinal-action-related downstream tasks, e.g. action segmentation and human activity recognition. We evaluate the performances of our approach on several video datasets: Georgia Tech Egocentric Activities (GTEA), 50Salads, and the Breakfast dataset. Br-Prompt achieves state-of-the-art on multiple benchmarks. Code is available at https://github.com/ttlmh/Bridge-Prompt
研究动机与目标
- 为解决传统动作识别模型在长教学视频中无法捕捉相邻动作之间上下文关系的局限性。
- 通过利用自然语言表达时间顺序与关系语义的能力,建模有序动作序列的语义。
- 开发一种基于提示的学习框架,联合训练视觉与文本编码器,以利用上下文外与上下文内动作信息。
- 提升下游任务(如动作分割与教学视频分析中的长期人类活动识别)的性能。
- 通过利用预训练语言模型的泛化能力,实现在相似动作之间的零样本迁移能力。
提出的方法
- 设计一种三加一层次的文本提示结构,将统计信息、序数信息与语义信息整合为统一的文本监督信号,用于动作序列建模。
- 构建一个视频-文本融合模块,在联合训练过程中通过交叉注意力机制对齐视频特征与对应文本提示。
- 采用基于语义与序列一致性对齐的对比学习目标,端到端联合训练视觉与文本编码器。
- 引入三种损失组件:语义损失($\mathcal{L}_{\text{sem}}$)、综合语义损失($\mathcal{L}_{\text{integ}}$)与统计损失($\mathcal{L}_{\text{stat}}$),以联合优化准确率与鲁棒性。
- 利用预训练的视觉与语言模型(如 ViT 和 BERT)作为编码器,以受益于大规模预训练,并实现有效的少样本与零样本泛化。
- 通过提示工程实现仅修改文本提示即可进行未见动作类型的零样本推理,无需重新训练。
实验结果
研究问题
- RQ1结构化文本提示能否有效建模教学视频中相邻动作之间的语义与序列关系?
- RQ2在提示中整合序数与上下文语义信息,是否能超越单动作分类,在动作识别与分割任务中带来性能提升?
- RQ3Bridge-Prompt 框架在基于提示的零样本迁移中,对未见动作类型或相似活动的泛化能力达到何种程度?
- RQ4不同损失组件(语义、综合语义、统计)对框架整体性能的贡献如何?
- RQ5在可扩展性、泛化能力与基准数据集上的性能方面,Bridge-Prompt 与基于图结构及基于类别ID的方法相比表现如何?
主要发现
- Bridge-Prompt 在 GTEA 数据集上达到最先进性能,F1@50 得分为 91.0,编辑得分为 89.6,优于先前方法。
- 消融实验表明,语义损失、综合语义损失与统计损失三者均对性能有正向贡献,完整损失组合取得最佳结果。
- 该框架展现出强大的零样本迁移能力:例如,从咖啡制作任务迁移到茶制作任务时,在 GTEA 上达到 41.7% 的 top-1 准确率与 81.3% 的 top-5 准确率。
- 与传统基于类别ID的方法相比,该方法在建模上下文动作关系方面表现显著更优,如图 1 所示,Bridge-Prompt 捕捉了个体标签所遗漏的跨动作语义。
- 与依赖手动重标记新动作的刚性类别ID系统不同,自然语言提示的使用实现了对未见动作类型的高效泛化。
- 通过精心设计的提示与对比学习策略,视觉编码器能够学习到更丰富、更具上下文意义的表征,从而在多个基准上显著提升下游任务性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。