Skip to main content
QUICK REVIEW

[论文解读] Multi-Task Learning of Object State Changes from Uncurated Videos

Tomáš Souček, Jean-Baptiste Alayrac|arXiv (Cornell University)|Nov 24, 2022
Multimodal Machine Learning Applications被引用 4
一句话总结

该论文提出了一种多任务自监督学习框架,仅使用噪声视频级监督信号,即可在长时、未经筛选的网络视频中联合定位物体状态及其状态改变动作。通过利用跨任务约束和端到端可训练的架构,该方法在ChangeIt数据集上相比先前单任务方法实现了40%的相对性能提升,并在第一人称视频上展现出强大的零样本泛化能力。

ABSTRACT

We aim to learn to temporally localize object state changes and the corresponding state-modifying actions by observing people interacting with objects in long uncurated web videos. We introduce three principal contributions. First, we explore alternative multi-task network architectures and identify a model that enables efficient joint learning of multiple object states and actions such as pouring water and pouring coffee. Second, we design a multi-task self-supervised learning procedure that exploits different types of constraints between objects and state-modifying actions enabling end-to-end training of a model for temporal localization of object states and actions in videos from only noisy video-level supervision. Third, we report results on the large-scale ChangeIt and COIN datasets containing tens of thousands of long (un)curated web videos depicting various interactions such as hole drilling, cream whisking, or paper plane folding. We show that our multi-task model achieves a relative improvement of 40% over the prior single-task methods and significantly outperforms both image-based and video-based zero-shot models for this problem. We also test our method on long egocentric videos of the EPIC-KITCHENS and the Ego4D datasets in a zero-shot setup demonstrating the robustness of our learned model.

研究动机与目标

  • 解决从长时、未经筛选的网络视频中学习物体状态变化及其对应动作的挑战,而无需人工标注的时序边界。
  • 通过在任务间共享表示,实现对多种相关交互任务(如切不同水果或倒液体)的高效联合学习。
  • 设计一种自监督学习过程,利用物体状态与动作之间的结构约束,实现从弱监督信号端到端的训练。
  • 评估模型在第一人称视频数据集(如EPIC-KITCHENS和Ego4D)上的零样本迁移能力,尽管其在第三人称网络视频上进行训练。

提出的方法

  • 该方法采用多任务神经网络架构,对每个视频片段联合预测物体状态(例如:完整、切开)和状态改变动作(例如:切、倒)。
  • 提出一种伪标签采样策略,通过强制执行逻辑约束(如确保每个视频仅预测一个动作,且当物体已处于最终状态时动作不发生)来生成训练信号。
  • 仅使用来自搜索查询的视频级标签(例如:“如何切菠萝”)进行端到端训练,无需任何帧级标注。
  • 通过自监督机制强制实现跨任务一致性:例如,模型学习到“倒咖啡”和“倒水”均导致杯子从空变为满。
  • 主干网络为单一图像编码器(如Swin-T),通过端到端微调,避免了对冻结特征或每个任务单独模型的依赖。
  • 该框架在大规模数据集(包括ChangeIt和COIN)上进行评估,并在EPIC-KITCHENS和Ego4D上进行了额外的零样本测试。

实验结果

研究问题

  • RQ1何种多任务网络架构能够有效实现不同物体状态变化与动作之间的信息共享?
  • RQ2在缺乏时序标注的情况下,如何设计自监督学习方法以利用物体状态与动作之间的结构约束?
  • RQ3在未见的、未经筛选的网络视频上进行训练的模型,能否在零样本设置下有效泛化到第一人称视频数据集?
  • RQ4在长时、未经筛选的视频上,联合多任务学习与单任务基线相比,在精度和鲁棒性方面表现如何?

主要发现

  • 所提出的多任务模型在ChangeIt数据集上相比先前单任务方法实现了40%的相对性能提升,状态精度提高14个百分点,动作精度提高12个百分点。
  • 该模型在相同基准上显著优于基于图像和基于视频的零样本模型,证明了联合学习与自监督的优势。
  • 与使用冻结特征相比,主干网络的端到端微调带来了显著的性能提升,即使仅使用单一图像编码器。
  • 该模型在零样本设置下对第一人称视频表现出稳健的泛化能力,在EPIC-KITCHENS和Ego4D上优于先前工作,尽管存在从第三人称到第一人称视角的域偏移。
  • 定性结果表明,模型能正确检索相关视频,准确定位初始状态、动作阶段和最终状态,并在不同视频示例中保持一致性。
  • 该模型能有效过滤无关视频(分类得分较低),并在多样化的视频片段中保持预测状态的视觉一致性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。