Skip to main content
QUICK REVIEW

[论文解读] HAKE: A Knowledge Engine Foundation for Human Activity Understanding

Yong–Lu Li, Xinpeng Liu|arXiv (Cornell University)|Feb 14, 2022
Context-Aware Activity Recognition Systems被引用 9
一句话总结

HAKE 提出了一种两阶段神经符号框架,用于人类活动理解,首先从图像中检测原子活动基元,然后利用可解释的逻辑规则推断高层语义。通过利用包含2600多万个基元标签和规则的大型知识库,HAKE 在基准数据集上实现了优于传统方法的泛化能力和性能表现,展示了在识别稀疏、杂乱活动模式方面的更强鲁棒性。

ABSTRACT

Human activity understanding is of widespread interest in artificial intelligence and spans diverse applications like health care and behavior analysis. Although there have been advances in deep learning, it remains challenging. The object recognition-like solutions usually try to map pixels to semantics directly, but activity patterns are much different from object patterns, thus hindering success. In this work, we propose a novel paradigm to reformulate this task in two stages: first mapping pixels to an intermediate space spanned by atomic activity primitives, then programming detected primitives with interpretable logic rules to infer semantics. To afford a representative primitive space, we build a knowledge base including 26+ M primitive labels and logic rules from human priors or automatic discovering. Our framework, the Human Activity Knowledge Engine (HAKE), exhibits superior generalization ability and performance upon canonical methods on challenging benchmarks. Code and data are available at http://hake-mvig.cn/.

研究动机与目标

  • 解决在复杂、杂乱场景中人类活动理解的挑战,因为低语义密度导致直接从像素到语义的映射失效。
  • 将活动识别重新构想为两阶段过程:基元检测后接基于逻辑的推理。
  • 构建一个包含2600多万个人工和机器发现的活动基元及逻辑规则的知识库,以实现泛化。
  • 通过聚焦于稀疏但有意义的视觉线索而非完整图像的语义,提升基准测试中的泛化能力和性能。
  • 通过将活动识别建模为基元发现与组合推理,弥合人类感知与人工智能之间的差距。

提出的方法

  • 提出一种两阶段框架:(1) 通过可微分检测头将输入图像映射到原子活动基元的中间空间。
  • 利用通过众包和自动发现收集的2600多万个基元标签的知识库,定义稀疏且具代表性的基元空间。
  • 采用神经符号推理引擎,使用显式、可解释的逻辑规则(例如布尔组合)对检测到的基元进行编程,以实现语义推理。
  • 应用可微分推理模块,使通过符号规则的反向传播实现端到端训练成为可能。
  • 采用语义覆盖率(SCR)作为度量指标,量化活动识别与物体识别中语义内容的稀疏性。
  • 使用人工标注和HAKE生成的掩码区域,评估并比较关键语义区域定位的质量。

实验结果

研究问题

  • RQ1两阶段范式——基元检测后接基于逻辑的推理——是否能在人类活动理解中优于直接的像素到语义映射?
  • RQ2活动图像中语义内容的稀疏性(以SCR衡量)如何影响端到端深度学习模型的性能?
  • RQ3包含原子活动基元和逻辑规则的知识库在零样本或少样本设置下,能在多大程度上提升泛化能力和鲁棒性?
  • RQ4HAKE生成的关键区域掩码与人工标注掩码在语义相关性和覆盖范围方面相比如何?
  • RQ5使用可解释逻辑规则的神经符号推理能否建模人类类似的组合泛化能力,用于活动感知?

主要发现

  • 与传统方法相比,HAKE在具有挑战性的基准测试中表现更优,且性能饱和点远高于直接映射方法。
  • 活动图像的平均语义覆盖率(SCR)仅为12.2%,显著低于物体图像的61.0%,这证明了新范式的需求。
  • 人类参与者在‘吃披萨’这一动作中仅标注了15.3%的区域(低SCR),表明活动识别依赖于稀疏且不明显的线索。
  • 在人类分类测试中,参与者仅能以59.55%的准确率区分HAKE生成的掩码与人工掩码,表明其语义对齐程度很高。
  • HAKE展现出一种‘抽象’能力,能检测到间接但关键的身体部位(例如‘滑滑板’中的手臂和臀部),而人类常会忽略这些部分。
  • 在模糊场景中(例如多个同时发生的动作),HAKE能保留更多组合语义,而人类往往仅标注物体,丢失交互语义。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。