Skip to main content
QUICK REVIEW

[论文解读] PromptonomyViT: Multi-Task Prompt Learning Improves Video Transformers using Synthetic Scene Data

Roei Herzig, Ofir Abramovich|arXiv (Cornell University)|Dec 8, 2022
Human Pose and Action Recognition被引用 4
一句话总结

PromptonomyViT 提出了一种用于视频视觉变换器的多任务提示学习框架,通过利用合成场景数据来提升真实世界视频理解能力。通过为辅助场景级任务(如深度估计、分割和法向量估计)引入特定任务的提示,该模型捕捉了合成任务之间的共享时空结构,并在无需领域自适应的情况下增强了下游动作识别性能,在多个基准测试中达到最先进水平。

ABSTRACT

Action recognition models have achieved impressive results by incorporating scene-level annotations, such as objects, their relations, 3D structure, and more. However, obtaining annotations of scene structure for videos requires a significant amount of effort to gather and annotate, making these methods expensive to train. In contrast, synthetic datasets generated by graphics engines provide powerful alternatives for generating scene-level annotations across multiple tasks. In this work, we propose an approach to leverage synthetic scene data for improving video understanding. We present a multi-task prompt learning approach for video transformers, where a shared video transformer backbone is enhanced by a small set of specialized parameters for each task. Specifically, we add a set of "task prompts", each corresponding to a different task, and let each prompt predict task-related annotations. This design allows the model to capture information shared among synthetic scene tasks as well as information shared between synthetic scene tasks and a real video downstream task throughout the entire network. We refer to this approach as "Promptonomy", since the prompts model task-related structure. We propose the PromptonomyViT model (PViT), a video transformer that incorporates various types of scene-level information from synthetic data using the "Promptonomy" approach. PViT shows strong performance improvements on multiple video understanding tasks and datasets. Project page: \url{https://ofir1080.github.io/PromptonomyViT}

研究动机与目标

  • 解决为真实视频数据集标注复杂场景级标签(如深度、分割和3D结构)所带来的高昂成本问题。
  • 探究具有丰富场景注释的合成数据是否能有效提升视频理解模型在真实世界任务中的表现。
  • 开发一个统一框架,使视频视觉变换器能够同时从多个合成场景任务和一个真实下游动作识别任务中学习。
  • 通过集成特定任务的提示,将信息在整个网络中传播,以最小化域差距问题。
  • 证明在低资源设置下,基于提示的多任务学习可优于标准微调和领域自适应技术。

提出的方法

  • 使用共享的视觉变换器(ViT)主干网络处理视频片段,为每个辅助场景级任务在输入层注入特定任务的可学习提示。
  • 每个任务提示是一组小规模的可学习参数,其关注视频标记并预测特定任务的输出,如深度图、语义分割图或法向量。
  • 提示通过来自多样化来源(如PHAV、HyperSim、KIST SynADL、EHOI)的合成数据进行端到端训练,每种数据提供不同类型的场景级监督信号。
  • 动作识别头在真实数据上使用[CLS]标记进行训练,而任务提示则由其对应的合成标签进行监督,从而实现知识迁移。
  • 该架构支持从早期层开始的跨任务信息流动,使不同合成任务之间能够形成共享表征,并惠及真实下游任务。
  • 该方法命名为“Promptonomy”,以反映其设计目的:管理任务间结构,并在统一的变换器框架中实现多任务学习。

实验结果

研究问题

  • RQ1具有多种注释类型的合成场景数据是否能提升视频理解模型在真实世界动作识别任务中的表现?
  • RQ2与标准微调或领域自适应相比,多任务提示学习在减少合成数据与真实数据之间的域差距方面表现如何?
  • RQ3特定任务提示在多大程度上能捕捉不同合成场景级任务之间的共享表征,并将其迁移到真实下游任务中?
  • RQ4包含多个辅助任务(如深度、分割、法向量)是否能带来比单任务预训练更好的泛化能力?
  • RQ5统一的基于提示的架构是否能有效管理多样化的场景级任务,而无需引入任务特定的头或领域自适应模块?

主要发现

  • PromptonomyViT 在 Something-Something V2、Diving48、Ego4D 和 AVA 基准测试中均达到最先进性能,优于标准微调和领域自适应基线方法。
  • 即使未进行显式领域自适应,该模型在使用多任务提示进行合成数据预训练后,仍能在动作识别任务上实现显著的准确率提升。
  • 定性结果表明,尽管训练过程中从未接触真实标签,任务提示仍能在真实视频帧上生成有意义且连贯的预测(如深度图、分割图、手-物体框等)。
  • 消融实验确认,使用多个具有专用提示的合成任务比仅使用一个或两个任务的性能更优。
  • 由于多任务提示带来的共享归纳偏置,该模型在多种视频领域(包括第一视角、多视角和人-物体交互视频)中表现出良好的泛化能力。
  • 任务提示的使用实现了从合成数据到真实数据的有效知识迁移,在低数据场景下也观察到了性能增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。