[论文解读] Visual Compositional Learning for Human-Object Interaction Detection
本文提出视觉组合学习(VCL),一种深度学习框架,将人-物体交互(HOI)特征分解为共享的动词和物体表征,然后在特征空间中组合生成新的HOI样本,以解决长尾分布问题并提升零样本和少样本检测性能。VCL在HICO-DET数据集上达到最先进性能,尤其在罕见和未见的HOI类别上表现优异,未见集的mAP最高提升达1.0。
Human-Object interaction (HOI) detection aims to localize and infer relationships between human and objects in an image. It is challenging because an enormous number of possible combinations of objects and verbs types forms a long-tail distribution. We devise a deep Visual Compositional Learning (VCL) framework, which is a simple yet efficient framework to effectively address this problem. VCL first decomposes an HOI representation into object and verb specific features, and then composes new interaction samples in the feature space via stitching the decomposed features. The integration of decomposition and composition enables VCL to share object and verb features among different HOI samples and images, and to generate new interaction samples and new types of HOI, and thus largely alleviates the long-tail distribution problem and benefits low-shot or zero-shot HOI detection. Extensive experiments demonstrate that the proposed VCL can effectively improve the generalization of HOI detection on HICO-DET and V-COCO and outperforms the recent state-of-the-art methods on HICO-DET. Code is available at https://github.com/zhihou7/VCL.
研究动机与目标
- 为解决人-物体交互(HOI)检测中的长尾分布问题,即许多动词-物体对在训练集中仅有少量或没有样本。
- 通过在多样化图像与交互中学习动词与物体的共享、解耦表征,提升零样本与少样本HOI检测性能。
- 通过视觉特征空间中的组合学习,实现新HOI样本与新型交互类型的生成。
- 通过联合框监督将动词表征与人和物体特征解耦,提升模型泛化能力。
- 开发一种简单但高效的框架,在大规模HOI基准上超越现有最先进方法。
提出的方法
- VCL使用带有共享权重的多分支网络,将HOI表征分解为独立的动词与物体特征。
- 通过人与物体的联合框构建动词表征,相比仅使用人框的特征,能更有效地捕捉交互特异性线索。
- 通过从不同图像与交互类型中拼接动词与物体特征,组合生成新的HOI样本,实现零样本与少样本泛化。
- 引入包含超参数λ₁和λ₂的损失函数,以平衡特征重建与组合学习,提升表征解耦程度。
- 采用重加权与后处理策略,提升基线检测性能,尤其对罕见类别效果显著。
- 通过增加每个小批量中的交互类别数量进行训练优化,实现在不增加GPU内存负担的前提下充分进行组合学习。
实验结果
研究问题
- RQ1动词与物体特征的组合学习是否能提升人-物体交互检测中的零样本与少样本泛化能力?
- RQ2相较于仅使用人框,使用人与物体的联合框进行动词表征学习对检测性能有何影响?
- RQ3在视觉特征空间中,能否有效组合生成新的HOI样本以缓解长尾分布问题?
- RQ4独立的动词-物体分支与空间-人分支在提升未见HOI类别检测性能方面分别起到何种作用?
- RQ5超参数λ₁与λ₂如何影响特征重建与组合泛化之间的权衡?
主要发现
- VCL在HICO-DET完整测试集上达到19.43 mAP,比之前最先进方法高出1.0 mAP。
- 在未见类别上,当优先选择罕见交互时,VCL达到7.55 mAP,较空间-人分支提升3.52%,较基线提升4.90%。
- 当优先处理罕见交互时,仅动词-物体分支即可使未见mAP提升7.85%,证明其具备强大的零样本泛化能力。
- 融合动词-物体分支与空间-人分支后,完整集mAP提升至16.58,表明两者具有互补优势。
- 与每批次仅处理单一交互类别相比,增加每批次的交互类别数量可使泛化性能提升1.0 mAP(从18.43提升至19.43 mAP)。
- 消融实验表明,重加权与后处理策略显著提升基线性能,尤其对罕见类别提升明显(从13.62提升至16.87 mAP)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。