Skip to main content
QUICK REVIEW

[论文解读] P3IV: Probabilistic Procedure Planning from Instructional Videos with Weak Supervision

He Zhao, Isma Hadji|arXiv (Cornell University)|May 4, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

本文提出P3IV,一种弱监督、概率性的程序规划框架,利用预训练的文本-视频嵌入实现语言监督,而非昂贵的时间视频标注。该框架采用单分支Transformer模型,结合记忆模块与概率生成模块,可并行生成多样且高质量的动作序列,在多个指标上优于完全监督的最先进模型,通过有效建模规划中的不确定性实现性能提升。

ABSTRACT

In this paper, we study the problem of procedure planning in instructional videos. Here, an agent must produce a plausible sequence of actions that can transform the environment from a given start to a desired goal state. When learning procedure planning from instructional videos, most recent work leverages intermediate visual observations as supervision, which requires expensive annotation efforts to localize precisely all the instructional steps in training videos. In contrast, we remove the need for expensive temporal video annotations and propose a weakly supervised approach by learning from natural language instructions. Our model is based on a transformer equipped with a memory module, which maps the start and goal observations to a sequence of plausible actions. Furthermore, we augment our model with a probabilistic generative module to capture the uncertainty inherent to procedure planning, an aspect largely overlooked by previous work. We evaluate our model on three datasets and show our weaklysupervised approach outperforms previous fully supervised state-of-the-art models on multiple metrics.

研究动机与目标

  • 解决从教学视频进行监督式程序规划时的高标注成本问题。
  • 通过利用自然语言指令作为弱监督,减少对昂贵时间视频标注的依赖。
  • 通过概率生成模块建模程序规划中的不确定性,实现多种可行计划。
  • 通过使用非自回归、单分支Transformer架构并行生成所有步骤,提升规划性能。
  • 利用KL散度、NLL、ModeRec和ModePrec等指标评估预测计划的质量与多样性。

提出的方法

  • 模型使用基于Transformer的解码器配合记忆模块,将起始和目标视觉观测映射为动作序列。
  • 通过教学步骤的预训练文本-视频嵌入,以语言监督替代昂贵的中间视觉标注。
  • 概率生成模块采样K=1500条动作序列,以建模不确定性并捕捉多种合理计划。
  • 模型通过对比学习在视觉与语言表示对上进行训练,计划质量通过KL散度与NLL评估。
  • 通过余弦距离衡量样本多样性,使用Mode Recall (ModeRec)与Mode Precision (ModePrec)评估计划的多样性与覆盖度。
  • 该方法采用一次推理机制,同时生成所有中间动作,而非自回归地逐步生成。

实验结果

研究问题

  • RQ1我们能否在不依赖教学视频中中间步骤昂贵时间标注的情况下,实现最先进水平的程序规划性能?
  • RQ2利用预训练的文本-视频嵌入作为弱监督,是否能比强视觉监督带来更好的泛化能力与规划质量?
  • RQ3非自回归、单分支Transformer模型能否有效并行生成多样且准确的动作序列?
  • RQ4通过概率采样建模不确定性,与确定性规划相比,如何提升计划的多样性与覆盖度?
  • RQ5KL散度、NLL、ModeRec与ModePrec等指标能否有效评估预测计划的质量与分布对齐情况?

主要发现

  • 我们的概率方法在T=3时的KL散度(2.11 vs. 2.31)与NLL(4.89 vs. 5.13)均低于确定性变体,表明与真实计划分布的对齐性更优。
  • 在T=3时,概率模型的Mode Recall提升9.89%,Mode Precision提升9.00%,表明对真实模式的覆盖度与准确性更高。
  • 在T=3时,样本间的余弦距离为0.384,表明生成计划具有高度多样性,而确定性模型无法实现此效果。
  • 尽管仅使用弱语言监督,该模型在多个指标上仍优于完全监督的SOTA方法,证明了所提方法的有效性。
  • 结果证实,通过概率采样建模不确定性可生成更鲁棒、更真实的规划,尤其在存在多种有效动作序列的场景中表现更优。
  • 使用预训练的文本-视频嵌入作为监督显著降低了标注成本,同时保持或提升了性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。