Skip to main content
QUICK REVIEW

[论文解读] End-to-End Human Object Interaction Detection with HOI Transformer

Cheng Zou, Bohan Wang|arXiv (Cornell University)|Mar 8, 2021
Multimodal Machine Learning Applications参考文献 39被引用 5
一句话总结

该论文提出HOI Transformer,一种基于Transformer编码器-解码器架构的端到端方法,用于直接并行预测(人,物体,交互)三元组的人-物交互检测。通过引入五重匹配损失并利用自注意力机制建模全局上下文,该方法在HICO-DET上达到26.61% AP的最先进性能,在V-COCO上达到52.9% AP_{role},优于先前方法,同时消除了人工设计的组件和复杂的后处理步骤。

ABSTRACT

We propose HOI Transformer to tackle human object interaction (HOI) detection in an end-to-end manner. Current approaches either decouple HOI task into separated stages of object detection and interaction classification or introduce surrogate interaction problem. In contrast, our method, named HOI Transformer, streamlines the HOI pipeline by eliminating the need for many hand-designed components. HOI Transformer reasons about the relations of objects and humans from global image context and directly predicts HOI instances in parallel. A quintuple matching loss is introduced to force HOI predictions in a unified way. Our method is conceptually much simpler and demonstrates improved accuracy. Without bells and whistles, HOI Transformer achieves $26.61\% $ $ AP $ on HICO-DET and $52.9\%$ $AP_{role}$ on V-COCO, surpassing previous methods with the advantage of being much simpler. We hope our approach will serve as a simple and effective alternative for HOI tasks. Code is available at https://github.com/bbepoch/HoiTransformer .

研究动机与目标

  • 解决两阶段或基于代理的HOI检测方法依赖独立的物体检测与交互分类阶段所存在的局限性。
  • 消除对手动设计组件(如人-物提议生成)和复杂后处理匹配策略的需求。
  • 在统一的端到端框架中,利用自注意力机制建模人与物体之间的长距离依赖关系。
  • 通过统一损失函数联合优化人、物体和交互预测,提升交互检测的准确性。
  • 证明更简单的基于注意力的架构可超越更复杂的多阶段流水线在HOI检测中的表现。

提出的方法

  • 采用Transformer编码器-解码器架构,其中CNN主干网络提取图像特征,编码器生成表示整个图像上下文的全局记忆特征。
  • 解码器关注全局记忆和HOI查询,为每个预测的HOI三元组(人,物体,交互)生成输出嵌入。
  • 通过多层感知机头将嵌入解码为边界框、类别标签和交互类别。
  • 引入五重匹配损失,通过在训练期间以一对一方式匹配预测和真实三元组,监督完整HOI实例的预测。
  • 推理阶段采用并行解码,实现多个HOI实例的同时输出,无需迭代匹配。
  • 可视化解码器的注意力图,分析模型如何聚焦于相关的人和物体区域以进行交互推理。

实验结果

研究问题

  • RQ1基于Transformer的端到端架构是否能在人-物交互检测中超越两阶段或基于代理的方法?
  • RQ2针对完整HOI三元组的统一损失函数是否相比解耦或代理监督能提升性能?
  • RQ3自注意力机制是否能在不依赖人工设计提议的情况下,有效建模人与物体之间的长距离依赖?
  • RQ4该模型在具有罕见或高密度交互模式的分布外场景中泛化能力如何?
  • RQ5模型的注意力机制在多大程度上能捕捉不同交互类别对应的判别性特征?

主要发现

  • HOI Transformer在HICO-DET基准上达到26.61% AP,优于先前最先进方法,且未使用额外特征或复杂后处理。
  • 在V-COCO基准上,其AP_{role}达到52.9%,展现出在交互角色预测上的强劲性能。
  • 模型在分布外测试案例中泛化良好,例如在训练数据中罕见的六次“用瓶子喝”的交互场景。
  • 解码器注意力图的可视化显示,模型通过同时关注人和物体区域,利用全局图像上下文进行交互推理。
  • 即使在空间布局相似的情况下,模型仍能区分不同交互类别,表明其具备有效的特征学习能力。
  • 由于无需后处理匹配和辅助组件(如人体姿态或部件特征),性能未受影响,凸显了模型的自洽性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。