Skip to main content
QUICK REVIEW

[论文解读] Category Query Learning for Human-Object Interaction Classification

Chi Xie, Fangao Zeng|arXiv (Cornell University)|Mar 24, 2023
Multimodal Machine Learning Applications被引用 4
一句话总结

该论文提出类别查询学习(Category Query Learning, CQL),一种用于人体-物体交互(HOI)分类的新方法,用可学习的、与类别相关的查询替代静态的类别权重向量。这些查询通过图像级分类头进行优化,自适应地表示交互类别,在HICO-DET数据集上实现了SOTA性能(36.03 mAP),且计算开销极低,适用于多种基线模型。

ABSTRACT

Unlike most previous HOI methods that focus on learning better human-object features, we propose a novel and complementary approach called category query learning. Such queries are explicitly associated to interaction categories, converted to image specific category representation via a transformer decoder, and learnt via an auxiliary image-level classification task. This idea is motivated by an earlier multi-label image classification method, but is for the first time applied for the challenging human-object interaction classification task. Our method is simple, general and effective. It is validated on three representative HOI baselines and achieves new state-of-the-art results on two benchmarks.

研究动机与目标

  • 为解决HOI分类中静态类别权重向量的局限性,后者无法有效建模不同交互类别间复杂的外观变化。
  • 通过为每个交互类别学习动态、图像自适应的表示,提升交互分类性能。
  • 提出一种简单、通用且高效的方法,可无缝集成至现有HOI框架中,无需重大架构修改。
  • 验证图像级类别查询学习的有效性,尤其在密集人体-物体交互场景中的表现。

提出的方法

  • 引入与特定交互类别显式关联的类别查询,并通过辅助的图像级分类任务进行训练。
  • 利用Transformer解码器将类别查询转换为图像特定的类别表示,实现对交互语义的自适应建模。
  • 用这些可学习的查询替代传统线性分类器中的静态权重向量,同时保持相同的推理机制。
  • 该方法轻量化且通用,可兼容任何输出人体-物体特征的现成HOI模型。
  • 这些查询为类别特异性,与其它HOI Transformer中使用的实例级查询不同,专注于全局图像级语义。
  • 训练过程联合优化HOI检测与图像级类别分类任务,从而稳定并引导类别表示的学习。

实验结果

研究问题

  • RQ1与静态权重向量相比,可学习的、类别特定的查询是否能提升HOI检测中的交互分类性能?
  • RQ2图像级类别查询学习是否能提供更好的泛化能力,尤其在复杂或密集的交互场景中?
  • RQ3在不同基准上,该方法与现有HOI基线相比,在性能和鲁棒性方面表现如何?
  • RQ4该方法在人类-物体交互密度更高的图像中是否表现出更显著的性能提升?
  • RQ5该方法是否能无需架构重大调整,有效集成至多种HOI框架中?

主要发现

  • 所提方法在HICO-DET基准上实现了36.03 mAP的新SOTA结果,优于所有三个测试的基线模型。
  • 该方法在所有评估设置下均一致提升了三个基线模型——两个基于Transformer的模型和一个两阶段模型。
  • 随着交互密度的增加,该方法的相对性能提升也更大,表明在更具挑战性的密集场景中收益更显著。
  • 定性分析显示,模型有效抑制了误报(例如,“board”类别的FP从0.29降至0.07),并提升了真正例(例如,“sit on bus”类别的TP从0.15提升至0.38)。
  • 该方法实现了正确的图像级类别打分,使错误类别获得低置信度分数,从而提升了整体检测的可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。