Skip to main content
QUICK REVIEW

[论文解读] GraFormer: Graph Convolution Transformer for 3D Pose Estimation

Weixi Zhao, Yunjie Tian|arXiv (Cornell University)|Sep 17, 2021
Human Pose and Action Recognition参考文献 37被引用 16
一句话总结

GraFormer 提出了一种基于 Transformer 的新型架构,结合图卷积模块用于 3D 人体姿态估计,通过将自注意力机制与可学习邻接矩阵图卷积(LAM-Gconv)及切比雪夫图卷积(ChebGConv)相结合,同时利用全局关节点关系与高阶结构依赖性。该方法在 Human3.6M 数据集上实现了最先进性能,参数量减少 18%,在 15 个类别中的 13 个类别中创下新的 SOTA 结果。

ABSTRACT

Exploiting relations among 2D joints plays a crucial role yet remains semi-developed in 2D-to-3D pose estimation. To alleviate this issue, we propose GraFormer, a novel transformer architecture combined with graph convolution for 3D pose estimation. The proposed GraFormer comprises two repeatedly stacked core modules, GraAttention and ChebGConv block. GraAttention enables all 2D joints to interact in global receptive field without weakening the graph structure information of joints, which introduces vital features for later modules. Unlike vanilla graph convolutions that only model the apparent relationship of joints, ChebGConv block enables 2D joints to interact in the high-order sphere, which formulates their hidden implicit relations. We empirically show the superiority of GraFormer through conducting extensive experiments across popular benchmarks. Specifically, GraFormer outperforms state of the art on Human3.6M dataset while using 18$\%$ parameters. The code is available at https://github.com/Graformer/GraFormer .

研究动机与目标

  • 为解决现有方法中 2D 关节点关系利用不足的问题,特别是感受野有限与结构信息丢失的问题。
  • 开发一种能够有效捕捉 2D 关节点之间全局交互与隐式高阶关系的模型。
  • 在不损害性能或参数效率的前提下,结合自注意力机制(全局上下文)与图卷积(结构归纳偏置)的优势。
  • 证明学习超越一阶连接关系的关节点关系可提升 3D 姿态估计的准确性。

提出的方法

  • 提出 GraAttention 模块,用基于可学习邻接矩阵的图卷积(LAM-Gconv)替代 Transformer 中的 MLP 头部,保留图结构的同时实现全局交互。
  • 采用 ChebGConv 模块通过图中多跳聚合特征,建模 2D 关节点之间的高阶关系,扩展有效感受野至一阶邻居之外。
  • 将 GraAttention 与 ChebGConv 模块堆叠为类似编码器的架构,从 2D 关节点坐标逐步优化 3D 姿态预测结果。
  • 在 LAM-Gconv 中使用可学习邻接矩阵,使关节点关系在训练过程中动态调整,提升特征表示学习能力。
  • 将 Transformer 中的标准 MLP 替换为 LAM-Gconv,避免 MLP 层在 2D 到 3D 回归任务中导致的性能下降。
  • 可视化图拉普拉斯矩阵,证明高阶 ChebGConv 操作激活了更远距离的关节点连接,揭示了隐式的结构关系。

实验结果

研究问题

  • RQ1将自注意力与图卷积结合,是否能通过同时保留全局上下文与结构归纳偏置,提升 3D 姿态估计性能?
  • RQ2高阶图卷积(ChebGConv)如何增强对超越一阶连接关系的隐式关节点关系的建模能力?
  • RQ3用图卷积层替代 Transformer 中的 MLP 头部,是否能提升性能并防止在 2D 到 3D 姿态估计中出现过拟合或性能退化?
  • RQ4与固定或仅学习注意力的机制相比,LAM-Gconv 中的可学习邻接矩阵在关节点交互建模方面提升了多少?
  • RQ5在多样化的基准测试中,GraFormer 与最先进方法相比,在准确率与参数效率方面表现如何?

主要发现

  • GraFormer 在 Human3.6M 数据集上达到 35.17 mm 的 MPJPE,仅使用 0.65M 参数,优于以往最先进方法。
  • 该模型在 Human3.6M 基准测试的 15 个类别中取得 13 个第一,证明其在多样化动作中具有持续优越性。
  • 消融实验表明,移除 GraAttention 或 ChebGConv 模块会导致性能显著下降,证实二者在模型中的关键作用。
  • Model-AM 将 GraAttention 替换为标准自注意力并保留 MLP,性能下降且无法收敛至 12 mm MPJPE 以下,而 GraFormer 表现更优。
  • 对学习到的邻接矩阵进行可视化,显示 GraFormer 有效识别出按肢体分组的关节点簇(如 2–4,5–7)及跨层的长程关系。
  • ChebGConv 可视化结果证实,高阶拉普拉斯矩阵激活了更远距离的关节点,证明其具备建模隐式非相邻关系的能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。