Skip to main content
QUICK REVIEW

[论文解读] Video-based Human-Object Interaction Detection from Tubelet Tokens

Danyang Tu, Wei Sun|arXiv (Cornell University)|Jun 4, 2022
Human Pose and Action Recognition被引用 8
一句话总结

该论文提出 TUTOR,一种用于基于视频的人-物体交互(V-HOI)检测的视觉 Transformer 模型,通过在时空上通过选择性注意力和聚合学习得到的管状标记(tubelet tokens),构建紧凑且表达性强的时空表征。该方法在 VidHOI 数据集上实现了 16.14% 的相对 mAP 提升,并且推理速度相比之前的方法快了 4 倍,展现出卓越的准确率与效率。

ABSTRACT

We present a novel vision Transformer, named TUTOR, which is able to learn tubelet tokens, served as highly-abstracted spatiotemporal representations, for video-based human-object interaction (V-HOI) detection. The tubelet tokens structurize videos by agglomerating and linking semantically-related patch tokens along spatial and temporal domains, which enjoy two benefits: 1) Compactness: each tubelet token is learned by a selective attention mechanism to reduce redundant spatial dependencies from others; 2) Expressiveness: each tubelet token is enabled to align with a semantic instance, i.e., an object or a human, across frames, thanks to agglomeration and linking. The effectiveness and efficiency of TUTOR are verified by extensive experiments. Results shows our method outperforms existing works by large margins, with a relative mAP gain of $16.14\%$ on VidHOI and a 2 points gain on CAD-120 as well as a $4 imes$ speedup.

研究动机与目标

  • 为解决基于视频的 HOI 检测中基于补丁的标记化方法在捕捉实例级语义方面存在的局限性,以及冗余与稀疏性问题。
  • 开发一种时空 Transformer 模型,通过端到端的标记抽象与连接,从视频中学习高度抽象化且与实例对齐的表征。
  • 通过将视频结构化为紧凑且表达性强的管状标记,提升 V-HOI 检测中的准确率与推理效率。
  • 相比现有方法,实现对长距离依赖关系与时间相关交互的更好建模。

提出的方法

  • TUTOR 采用两阶段标记化流程:首先通过选择性注意力在空间上识别语义相关的补丁标记,随后将其聚合为实例级标记以减少冗余。
  • 通过可学习的非规则窗口操作执行标记聚合,选择性地合并语义相似的标记,避免使用固定大小的池化操作。
  • 时间连接将跨帧的实例标记连接形成管状标记,实现与随时间动态变化的人-物体实例在时间维度上的对齐。
  • 空间与时间位置编码分别处理——空间聚合使用 2D 编码,时间连接使用 1D 编码,以更好地建模时空动态。
  • 通过可学习的投影头提升聚合后标记的维度,增强特征丰富度与模型性能。
  • 整个框架采用端到端训练,支持标记生成与交互预测的联合优化。

实验结果

研究问题

  • RQ1可学习的自适应标记化策略是否能在基于视频的 HOI 检测中超越固定的补丁基标记化方法?
  • RQ2在空间上通过选择性注意力与聚合是否能提升视频特征的表征紧凑性并减少冗余?
  • RQ3跨帧的实例标记时间连接是否能增强与动态人-物体交互的对齐能力?
  • RQ4所提出的管状标记化方法是否相比 SOTA 方法在 mAP 和推理速度上带来显著提升?

主要发现

  • 与之前 SOTA 方法相比,TUTOR 在 VidHOI 数据集上实现了 16.14% 的相对 mAP 提升。
  • 在 CAD-120 数据集上,F1 分数提升了 2 个百分点,表明在小规模基准上具有强大的泛化能力。
  • 与现有基于 Transformer 的 V-HOI 方法相比,TUTOR 实现了 4 倍的推理速度提升,显示出极高的效率。
  • 消融实验证实,提升聚合后标记的维度可带来超过 6% 的 mAP 提升,凸显了特征丰富度的重要性。
  • 用可学习的聚合替代 k-means 聚类,性能显著提升,表明端到端优化具有显著优势。
  • 为空间与时间模块分别使用 2D 和 1D 位置编码,相比标准的 3D 编码,性能更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。