[论文解读] PaStaNet: Toward Human Activity Knowledge Engine
本文提出了 PaStaNet,一种基于细粒度人体部位状态(PaSta)的大规模人体活动知识引擎,例如 ⟨hand, hold, something⟩。通过利用 PaStaNet 进行预训练,作者提出了 Activity2Vec 以实现部件级别的表征学习,以及 PaSta-R 以实现对部件状态的推理,在 HICO、V-COCO 和 AVA 基准上的监督学习与少样本迁移学习中均取得了最先进性能,尤其在单样本 HICO 上 mAP 提升高达 13.9%。
Existing image-based activity understanding methods mainly adopt direct mapping, i.e. from image to activity concepts, which may encounter performance bottleneck since the huge gap. In light of this, we propose a new path: infer human part states first and then reason out the activities based on part-level semantics. Human Body Part States (PaSta) are fine-grained action semantic tokens, e.g. , which can compose the activities and help us step toward human activity knowledge engine. To fully utilize the power of PaSta, we build a large-scale knowledge base PaStaNet, which contains 7M+ PaSta annotations. And two corresponding models are proposed: first, we design a model named Activity2Vec to extract PaSta features, which aim to be general representations for various activities. Second, we use a PaSta-based Reasoning method to infer activities. Promoted by PaStaNet, our method achieves significant improvements, e.g. 6.4 and 13.9 mAP on full and one-shot sets of HICO in supervised learning, and 3.2 and 4.2 mAP on V-COCO and images-based AVA in transfer learning. Code and data are available at http://hake-mvig.cn/.
研究动机与目标
- 为解决图像中活动理解性能受限于像素与高层活动概念之间巨大语义鸿沟的问题。
- 构建一个大规模、细粒度的人体部位状态知识库(PaSta),作为可泛化活动理解的基础。
- 开发一种可复用且可解释的活动识别框架,利用部件级别语义与迁移学习。
- 通过从 PaStaNet 中蒸馏知识,实现在少样本与零样本设置下的显著性能提升。
提出的方法
- 构建 PaStaNet,一个大规模知识库,包含超过 700 万条人体部位状态标注,覆盖 11.8 万张图像、28.5 万名人物与 72.4 万项活动。
- 设计 Activity2Vec,通过结合视觉特征与 BERT 编码的 PaSta 三元组(部位,动词,对象),提取通用的、部件级别的语义表征。
- 提出 PaSta-R,一种分层推理模型,通过构建人物实例与部位状态的图结构,利用实例级别与部件级别子图状态来推断完整活动。
- 将 PaStaNet 用作迁移学习的预训练源,在目标基准上仅微调最后一层,同时冻结 Activity2Vec。
- 与最先进模型进行后期融合,结合部件级别推理与实例级别检测,以提升性能。
- 采用余弦退火重启策略与 SGD 进行训练,通过精心的数据划分避免预训练与微调之间的领域偏移。
实验结果
研究问题
- RQ1细粒度的人体部位状态(PaSta)能否作为可复用、可解释的语义标记,用于构建通用的人体活动知识引擎?
- RQ2通过 PaStaNet 学习部件级别表征是否能提升图像中活动理解的性能,特别是在少样本或零样本条件下?
- RQ3基于 PaSta 的推理是否能在准确性、可迁移性与可解释性方面优于直接的像素到活动映射?
- RQ4PaStaNet 作为下游活动识别任务的预训练源,在存在领域差异时效果如何?
主要发现
- 在 HICO-DET 的完整数据集上,PaStaNet 实现了 6.4 mAP 的提升,在单样本设置上 mAP 提升高达 13.9%。
- 在迁移学习中,PaStaNet 在 V-COCO 上提升 3.2 mAP,在基于图像的 AVA 上提升 4.2 mAP,展现出强大的泛化能力。
- 消融实验证实,部件注意力机制与 BERT 编码的 PaSta 特征至关重要,当移除部件注意力时性能下降 0.21 mAP。
- 将 PaSta-BERT 替换为 Word2Vec 或 GloVe 会导致性能下降,而使用完整句子作为输入则带来轻微的 0.14 mAP 提升(达到 22.26 mAP)。
- 该方法对领域偏移表现出强鲁棒性,在训练数据为静态图像、测试数据为视频类数据的情况下,HICO-DET 上仍实现 3.25 mAP 的提升。
- 即使与实例级别模型通过后期融合结合,PaSta-R 仍达到最先进性能,凸显了部件级别推理的价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。