[论文解读] Induce, Edit, Retrieve: Language Grounded Multimodal Schema for Instructional Video Retrieval
该论文提出了一种名为 Induce, Edit, Retrieve(IER)的新框架,通过指令视频中的显式语言结构图式(schemata)并利用 BERT 驱动的文本编辑技术将其泛化至未见任务,从而实现零样本指令视频检索。通过利用所诱导的图式扩展简短查询,IER 在基准数据集上的零样本指令视频检索性能显著提升,Top-1 精度相比现有方法提高近 10%。
Schemata are structured representations of complex tasks that can aid artificial intelligence by allowing models to break down complex tasks into intermediate steps. We propose a novel system that induces schemata from web videos and generalizes them to capture unseen tasks with the goal of improving video retrieval performance. Our system proceeds in three major phases: (1) Given a task with related videos, we construct an initial schema for a task using a joint video-text model to match video segments with text representing steps from wikiHow; (2) We generalize schemata to unseen tasks by leveraging language models to edit the text within existing schemata. Through generalization, we can allow our schemata to cover a more extensive range of tasks with a small amount of learning data; (3) We conduct zero-shot instructional video retrieval with the unseen task names as the queries. Our schema-guided approach outperforms existing methods for video retrieval, and we demonstrate that the schemata induced by our system are better than those generated by other models.
研究动机与目标
- 通过从视频-文本数据中学习显式、可解释的图式,提升零样本指令视频检索性能。
- 通过语言模型驱动的图式编辑,实现对未见任务的泛化。
- 证明所诱导的图式在检索任务中优于大型语言模型(如 GPT-3)生成的图式。
- 验证图式在不同视频-文本匹配模型(如 CLIP 和 MIL-NCE)之间的可迁移性。
- 探究图式对检索性能的影响,特别是在视频长度增加时的表现。
提出的方法
- 通过联合视频-文本匹配模型将视频片段与 wikiHow 步骤描述进行匹配,保留得分较高的句子-视频对,以诱导图式。
- 仅使用每项任务 50 个视频,构建特定于任务的图式,作为自然语言步骤的集合,以实现高质量的图式诱导。
- 通过三种编辑方法将图式泛化至未见任务:基于任务名称对齐的对象替换、基于低相关性得分的步骤删除,以及基于 BERT 的低概率 token 替换。
- 利用编辑后的图式将简短查询术语(如“Bake Fish”)扩展为多句描述,以与视频片段进行匹配。
- 使用匹配函数 F 将扩展后的图式与长视频中的短片段对齐,利用 MIL-NCE 或基于 CLIP 的特征进行检索。
- 在 Howto100M、COIN 和 YouCook2 数据集上,使用标准指标(P@1、R@5、R@10、Med r、MRR)评估检索性能。
实验结果
研究问题
- RQ1从视频和文本中诱导的图式能否提升对未见任务的零样本视频检索性能?
- RQ2通过语言模型编辑现有图式,是否能以极少数据实现对新任务的有效泛化?
- RQ3IER 的性能与不使用图式或使用 LLM 生成图式的检索方法相比如何?
- RQ4所诱导的图式在不同视频-文本匹配模型之间的可迁移性如何?
- RQ5随着视频长度增加,图式的优势是否会增强?
主要发现
- 与不使用图式的基线方法相比,IER 在 COIN 数据集上的 Top-1 精度提升了近 10%,达到 57.2% P@1。
- IER 编辑后的图式在检索性能上优于 GPT-3 生成的图式,证明了视频诱导图式的优越性。
- 消融实验表明,所有三种编辑模块(对象替换、步骤删除、token 替换)均能提升检索性能,尤其在任务相似性较低时(如 Howto-GEN 和 COIN)效果更显著。
- 在 YouCook2 上,编辑模块效果较弱,原因在于其与 Howto100M 的任务相似性较高(平均 0.97),表明当源任务与目标任务差异较大时,编辑最有效。
- 图式可有效迁移至基于 CLIP 的匹配模型:当与 CLIP 结合使用时,COIN 数据集上的 P@1 从 58.9% 提升至 65.0%。
- 随着视频长度增加,图式的优势也随之增强,因为更长的视频包含更多可匹配的片段,且图式能提升在长内容中的检索可靠性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。