Skip to main content
QUICK REVIEW

[论文解读] Learning Visual Symbols for Parsing Human Poses in Images

Fang Wang, Yi Li|arXiv (Cornell University)|Apr 23, 2013
Human Pose and Action Recognition参考文献 20被引用 4
一句话总结

该论文提出了一种新颖的人体姿态解析方法,通过从图像特征中学习自包含的视觉符号,并使用带交叉验证的潜在SVM对基于几何上下文的部件外观进行分类。该方法对身体各部分之间的细粒度、符号化几何关系进行建模,实现了在树状结构图模型上的高效精确推理,在PARSE和LSP数据集上分别取得了75.7%和65.2%的总检测准确率,达到当前最优性能。

ABSTRACT

Parsing human poses in images is fundamental in extracting critical visual information for artificial intelligent agents. Our goal is to learn self-contained body part representations from images, which we call visual symbols, and their symbol-wise geometric contexts in this parsing process. Each symbol is individually learned by categorizing visual features leveraged by geometric information. In the categorization, we use Latent Support Vector Machine followed by an efficient cross validation procedure to learn visual symbols. Then, these symbols naturally define geometric contexts of body parts in a fine granularity. When the structure of the compositional parts is a tree, we derive an efficient approach to estimating human poses in images. Experiments on two large datasets suggest our approach outperforms state of the art methods.

研究动机与目标

  • 解决姿态估计中粗粒度、非区分性身体部件表征所导致的推理不可行问题。
  • 利用几何与外观特征,学习自包含的、具有判别性的视觉符号以表示组合式身体部件。
  • 通过符号化关系对部件之间的细粒度几何上下文进行建模,提升姿态解析的准确性。
  • 通过将姿态模型结构化为树形,实现高效精确推理,避免使用近似推理方法。
  • 在大规模基准数据集上,证明该方法优于当前最先进方法。

提出的方法

  • 通过使用方向梯度直方图(HOG)特征对图像块进行分类,并应用带交叉验证的潜在支持向量机(Latent SVM),学习视觉符号。
  • 每个符号代表一种身体部件的独特视觉模式,捕捉其外观与几何构型。
  • 符号化几何上下文被建模为部件之间的细粒度分布,相比全局分布可降低方差。
  • 姿态解析模型被结构化为树形,通过动态规划或类似方法实现高效精确推理。
  • 该方法采用组合部件层次结构,部件可为分层结构(如大腿和小腿)或扁平结构,实现灵活建模。
  • 最终姿态通过最大化结合部件检测与几何上下文项的结构化得分函数来估计。

实验结果

研究问题

  • RQ1能否从图像数据中有效学习出自包含的视觉符号以提升人体姿态解析性能?
  • RQ2符号化几何上下文是否能比全局分布更准确地建模身体部件之间的细粒度关系?
  • RQ3使用基于学习符号的树状结构模型,是否能实现比近似方法更快更准确的推理?
  • RQ4该方法是否能在大规模、具有挑战性的数据集上超越当前最先进方法?
  • RQ5该方法如何通过基于符号的推理处理遮挡和模糊姿态?

主要发现

  • 在PARSE数据集上,该方法实现了75.7%的总检测准确率,略高于Yang和Ramanan(2011)的74.9%。
  • 在更具挑战性的LSP数据集上,该方法实现了65.2%的总检测准确率,超过所有对比方法,包括Johnson和Everingham(2011)的62.7%。
  • 该方法优于Tian等(2012)的5个模型(61.3%)和Andriluka等(2009)(47.1%),在困难样本上表现出更强鲁棒性。
  • 性能提升归因于通过符号分类对细粒度几何上下文进行更优建模,从而降低了部件位置分布的方差。
  • 该方法实现了具有竞争力的推理速度(每张320×240图像1.5秒),与Yang和Ramanan(2011)相当,同时使用精确推理而非环状信念传播。
  • 视觉结果表明,由于符号引导的几何约束,姿态估计更加均衡且合理,尤其在区分双腿和处理自遮挡方面表现更优。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。