[论文解读] Multimodal Subtask Graph Generation from Instructional Videos
该论文提出MSG²,一种多模态方法,通过整合视觉和文本信号,从噪声较大的教学视频中生成子任务图,以推断缺失的子任务并建模因果依赖关系。在ProceL和CrossTask数据集上,其在下一子任务预测任务中的表现分别优于视频变换器模型85%和30%,达到当前最先进水平。
Real-world tasks consist of multiple inter-dependent subtasks (e.g., a dirty pan needs to be washed before it can be used for cooking). In this work, we aim to model the causal dependencies between such subtasks from instructional videos describing the task. This is a challenging problem since complete information about the world is often inaccessible from videos, which demands robust learning mechanisms to understand the causal structure of events. We present Multimodal Subtask Graph Generation (MSG2), an approach that constructs a Subtask Graph defining the dependency between a task's subtasks relevant to a task from noisy web videos. Graphs generated by our multimodal approach are closer to human-annotated graphs compared to prior approaches. MSG2 further performs the downstream task of next subtask prediction 85% and 30% more accurately than recent video transformer models in the ProceL and CrossTask datasets, respectively.
研究动机与目标
- 从多条噪声较大的教学视频中建模现实世界任务中子任务之间的因果依赖关系。
- 通过多模态推理,解决网络视频中的数据噪声问题,如缺失、错序或部分标注的子任务。
- 生成更具表现力的子任务图表示,以捕捉复杂依赖关系(例如“与”条件),优于先前方法。
- 利用推断出的子任务图结构,提升下游任务性能,特别是下一子任务预测任务的性能。
- 开发一个鲁棒的框架,能够泛化于多样化的视频演示,并处理不完整或不一致的标注。
提出的方法
- 使用多模态子任务状态预测,通过视频帧和自动语音识别(ASR)生成的文本,推断每个子任务的进展状态。
- 应用复杂度受限的归纳逻辑编程(ILP)方法,从不完整且噪声较大的子任务序列中推断子任务依赖关系。
- 构建具有表达性节点(如“与”节点)的子任务图,以建模多个前置条件和复杂依赖关系。
- 利用同一任务的多个视频实例,整合信息以提升对数据噪声的鲁棒性。
- 融合视觉和语言信号,恢复标注中未包含的子任务,如被省略或未标注的步骤。
- 采用两阶段流程:首先预测每段视频的子任务状态,然后基于聚合预测结果生成统一的子任务图。
实验结果
研究问题
- RQ1如何从多条噪声大、不完整的教学视频中稳健地推断因果子任务依赖关系?
- RQ2在存在标注错误的情况下,多模态信号(视觉和文本)在多大程度上能提升子任务恢复和图结构预测的性能?
- RQ3复杂度正则化的ILP方法能否有效从噪声大、不完整的子任务序列中生成准确的子任务图?
- RQ4与端到端视频建模方法相比,生成的子任务图在提升下游任务(如下一子任务预测)性能方面有何优势?
- RQ5使用多个视频演示对子任务图生成的鲁棒性和准确性有何影响?
主要发现
- MSG²生成的子任务图与人工标注图相比显著更接近,表明其结构准确性得到提升。
- 在ProceL数据集上,该方法相比近期视频变换器模型,下一子任务预测准确率提升了85%。
- 在CrossTask数据集上,MSG²相比最先进视频变换器模型,下一子任务预测准确率提升了30%。
- 多模态子任务状态预测模块能有效恢复标注中缺失的子任务,提升图的完整性。
- 复杂度受限的ILP方法成功处理了噪声大和不完整的数据,生成了更可靠且可解释的子任务图。
- 两阶段设计(子任务状态预测后接图生成)相比端到端方法,实现了更好的泛化能力和性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。