Skip to main content
QUICK REVIEW

[论文解读] Novel Human-Object Interaction Detection via Adversarial Domain Generalization

Yuhang Song, Wenbo Li|arXiv (Cornell University)|May 22, 2020
Multimodal Machine Learning Applications参考文献 44被引用 5
一句话总结

本文提出了一种对抗性域泛化框架,以提升在新型人类-物体交互(HOI)检测任务中的零样本泛化能力,其中测试阶段的谓词-对象组合在训练阶段未见。通过学习与物体无关的特征,结合条件与无条件的域泛化,该方法在新的 HICO-DET 划分上性能最高提升 50%,在 UnRel 上性能最高提升 125%,显著优于基线方法,尤其在检测未见 HOI 三元组方面表现优异。

ABSTRACT

We study in this paper the problem of novel human-object interaction (HOI) detection, aiming at improving the generalization ability of the model to unseen scenarios. The challenge mainly stems from the large compositional space of objects and predicates, which leads to the lack of sufficient training data for all the object-predicate combinations. As a result, most existing HOI methods heavily rely on object priors and can hardly generalize to unseen combinations. To tackle this problem, we propose a unified framework of adversarial domain generalization to learn object-invariant features for predicate prediction. To measure the performance improvement, we create a new split of the HICO-DET dataset, where the HOIs in the test set are all unseen triplet categories in the training set. Our experiments show that the proposed framework significantly increases the performance by up to 50% on the new split of HICO-DET dataset and up to 125% on the UnRel dataset for auxiliary evaluation in detecting novel HOIs.

研究动机与目标

  • 为解决由于物体-谓词对的长尾分布和组合爆炸导致的难以泛化到未见人类-物体交互(HOI)三元组组合的问题。
  • 通过学习与物体无关的特征以减轻现有 HOI 检测器对频率先验的依赖,从而提升谓词分类能力。
  • 构建 HICO-DET 的新基准划分以及来自 UnRel 的辅助评估集,其中测试三元组在训练中完全未见。
  • 开发一个统一的对抗性域泛化框架,可无缝集成至现有 HOI 模型中,以增强泛化性能。

提出的方法

  • 提出一个统一的对抗性域泛化(ADG)框架,通过最小化不同物体类别之间的域偏移,学习用于谓词预测的与物体无关的特征。
  • 设计 ADG 的条件与无条件两种变体:CADG(条件)与 ADG(无条件),其中前者显式地基于物体特征进行条件化,以提升特征解耦能力。
  • 引入三分支特征提取头:人体框(H)、空间特征(Sp)与联合框(U),其中联合框分支用于捕捉人-物交互的联合特征。
  • 通过对抗训练实现域泛化,使用域判别器促使模型在不同物体类别上生成域不变的特征。
  • 采用 Kullback-Leibler(KLD)与 Jensen-Shannon(JSD)散度作为域对齐损失,以优化不同域之间的特征分布。
  • 引入 Grad-CAM 可视化分析注意力图,验证模型是否聚焦于与交互相关区域,而非虚假线索。

实验结果

研究问题

  • RQ1对抗性域泛化是否能有效提升在零样本设置下对未见人类-物体交互三元组组合的泛化能力?
  • RQ2与无条件 ADG 相比,条件域泛化(CADG)在学习用于谓词分类的与物体无关特征方面表现如何?
  • RQ3所提框架在多大程度上减少了对频率先验的依赖,并提升了长尾与新型 HOI 检测的性能?
  • RQ4对抗性域泛化如何改变模型的注意力图?其是否与人类交互区域对齐?
  • RQ5所提出的包含未见测试三元组的基准是否能有效评估零样本 HOI 泛化性能?

主要发现

  • 所提 CADG-JSD 方法在新型 HICO-DET 测试划分上的 R@1 相对提升达 95.4%,最终 R@1 达 43.47。
  • 在 UnRel 数据集上,CADG-JSD 模型的 R@1 相对提升达 95.4%,表明其在罕见与未见场景中具备强大的零样本泛化能力。
  • CADG-KLD 与 CADG-JSD 模型在联合框分支上分别实现 60–100% 的性能提升,表明其有效学习了交互感知特征。
  • Grad-CAM 可视化结果表明,CADG 模型关注于正确的交互区域(如手-物体接触区域),而基线模型则聚焦于无关身体部位(如眼睛)。
  • 消融实验表明,条件 ADG(CADG)显著优于无条件 ADG(ADG),证明显式基于物体特征的条件化可增强特征解耦能力。
  • HICO-DET 的新基准划分与 UnRel 评估集能有效隔离未见三元组组合,从而实现对泛化性能的可靠零样本评估。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。