[论文解读] Human-Object Interaction Detection via Disentangled Transformer
本文提出了一种新型的HOI检测框架——解耦Transformer(DisTR),通过解耦三元组预测为人体-物体对检测与交互分类,采用解耦编码器和解码器。通过使用基础解码器进行统一表征,并结合注意力融合的粗到细优化策略,DisTR在V-COCO和HICO-DET数据集上实现了最先进性能,显著优于先前方法,同时保持了高效的FLOPs和参数量。
Human-Object Interaction Detection tackles the problem of joint localization and classification of human object interactions. Existing HOI transformers either adopt a single decoder for triplet prediction, or utilize two parallel decoders to detect individual objects and interactions separately, and compose triplets by a matching process. In contrast, we decouple the triplet prediction into human-object pair detection and interaction classification. Our main motivation is that detecting the human-object instances and classifying interactions accurately needs to learn representations that focus on different regions. To this end, we present Disentangled Transformer, where both encoder and decoder are disentangled to facilitate learning of two sub-tasks. To associate the predictions of disentangled decoders, we first generate a unified representation for HOI triplets with a base decoder, and then utilize it as input feature of each disentangled decoder. Extensive experiments show that our method outperforms prior work on two public HOI benchmarks by a sizeable margin. Code will be available.
研究动机与目标
- 为解决现有HOI Transformer方法存在的误分组错误以及人体-物体实例与交互之间缺乏联合建模的问题。
- 通过为人体-物体对和交互学习解耦表征,提升HOI检测的准确性和可解释性。
- 通过解耦物体对和交互动词的预测,提升对罕见HOI类别的一般化能力。
- 设计一种统一的关联机制,通过基础解码器优化预测,并促进解耦解码器之间的信息交互。
提出的方法
- 该方法提出一种解耦Transformer架构,其中编码器和解码器均分为两条并行流:一条用于人体-物体对检测,另一条用于动词分类。
- 基础解码器首先为所有HOI三元组生成统一表征,随后以粗到细的方式将其作为输入,用于优化解耦解码器。
- 引入注意力融合模块,实现实例解码器与交互解码器之间的信息交换,增强跨任务理解能力。
- 重新定义实例解码器,直接预测具有交互关系的人体-物体对,而非单独预测物体,从而减少误分组错误。
- 框架采用基于查询的集合预测机制与交叉注意力机制,其中每个解码器关注不同的空间区域,经由注意力可视化验证。
- 模型采用端到端训练,使用一组可学习查询与二分图匹配损失,确保预测三元组与真实三元组之间的对齐。
实验结果
研究问题
- RQ1将HOI三元组预测解耦为人体-物体对检测与交互分类,是否能提升检测准确率并减少误分组错误?
- RQ2同时对编码器和解码器组件进行解耦,是否能提升HOI检测中不同子任务的表征学习能力?
- RQ3使用统一基础解码器的粗到细关联策略,是否能改善预测人体-物体对与交互动词之间的对齐?
- RQ4注意力融合模块在不损害任务特异性关注的前提下,是否能有效促进解耦解码器之间的信息通信?
- RQ5由于改进的解耦与表征学习,该方法是否对罕见HOI类别具有更好的泛化能力?
主要发现
- 在V-COCO测试集场景#1下,DisTR实现了66.2的新SOTA mAP,显著优于先前方法如QPIC(58.8)和HOTR(55.2)。
- 在HICO-DET基准上,DisTR达到47.8的mAP,超越了先前SOTA方法如QPIC(44.0)和HOTR(45.1)。
- 消融研究显示,若将统一表征替换为可学习查询(查询分解),V-COCO上mAP下降1.3%,HICO-DET上下降0.66%,证实了粗到细关联策略的有效性。
- 交叉注意力图可视化结果表明,实例解码器关注物体的边缘区域,而交互解码器聚焦于交互区域,验证了表征学习的解耦性。
- 模型保持高效计算,ResNet-50主干网络下仅比QPIC多7% FLOPs,展示了良好的准确率-效率权衡。
- 解耦编码器与解码器设计提升了可解释性,并因任务特异性注意力机制,显著改善了长尾HOI类别上的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。