Skip to main content
QUICK REVIEW

[论文解读] TORE: Token Reduction for Efficient Human Mesh Recovery with Transformer

Zhiyang Dou, Qingxuan Wu|arXiv (Cornell University)|Nov 19, 2022
Advanced Neural Network Applications被引用 4
一句话总结

TORE 提出了一种用于高效 Transformer 基行人网格重建的标记剪枝框架,通过利用骨骼几何先验和可学习聚类,剪除冗余的 2D 图像特征与 3D 网格顶点。通过采用分层几何感知查询与无监督特征聚类减少标记数量,TORE 在 Human3.6M 和 3DPW 基准上实现了 SOTA 准确率,同时将 FLOPs 降低高达 78%,吞吐量提升 2.5 倍,展现出出色的效率-准确率权衡。

ABSTRACT

In this paper, we introduce a set of simple yet effective TOken REduction (TORE) strategies for Transformer-based Human Mesh Recovery from monocular images. Current SOTA performance is achieved by Transformer-based structures. However, they suffer from high model complexity and computation cost caused by redundant tokens. We propose token reduction strategies based on two important aspects, i.e., the 3D geometry structure and 2D image feature, where we hierarchically recover the mesh geometry with priors from body structure and conduct token clustering to pass fewer but more discriminative image feature tokens to the Transformer. Our method massively reduces the number of tokens involved in high-complexity interactions in the Transformer. This leads to a significantly reduced computational cost while still achieving competitive or even higher accuracy in shape recovery. Extensive experiments across a wide range of benchmarks validate the superior effectiveness of the proposed method. We further demonstrate the generalizability of our method on hand mesh recovery. Visit our project page at https://frank-zy-dou.github.io/projects/Tore/index.html.

研究动机与目标

  • 为解决基于 Transformer 的行人网格重建(HMR)因输入特征与网格顶点中存在冗余标记而导致的高计算成本问题。
  • 通过利用人体结构几何中的结构先验与判别性图像特征,在不损失准确率的前提下提升效率。
  • 开发一种轻量级、端到端可训练的标记剪枝机制,以剪除非信息性标记,同时保持几何保真度。
  • 验证方法在手部网格重建中的泛化能力,以及在部分遮挡与复杂视角下的鲁棒性。
  • 在单目 HMR 中实现准确率与推理速度之间的帕累托最优平衡。

提出的方法

  • 提出一种神经形状回归器(NSR),利用少量骨骼层级的体素标记,分层回归完整网格顶点,从而降低顶点间注意力的复杂度。
  • 提出一种可学习的无监督标记剪枝器,通过基于聚类的选择方法对 CNN 特征块进行聚类,仅保留具有判别性的图像标记。
  • 采用注意力矩阵分解,将分层网格重建解释为结构化注意力机制,利用骨骼先验引导特征交互。
  • 采用单次遍历、端到端的训练方案,无需额外标注,实现剪枝与网格回归的联合优化。
  • 通过经验选择 20% 的剪枝率以平衡准确率与效率,并在多个基准上进行了验证。
  • 将标记剪枝模块集成至 FastMETRO 和 METRO 风格架构中,实现即插即用的效率提升。

实验结果

研究问题

  • RQ1在 2D 图像特征与 3D 网格顶点中剪枝冗余标记,是否能显著降低基于 Transformer 的 HMR 的计算成本,同时不损害准确率?
  • RQ2利用骨骼关节先验替代完整网格顶点查询,在注意力机制中是否能有效实现几何感知的网格重建?
  • RQ3无监督的基于聚类的标记剪枝器是否能识别出具有语义意义的图像特征,从而提升泛化能力并降低 FLOPs?
  • RQ4所提出的标记剪枝策略在部分遮挡与复杂单目视角下是否能保持或提升性能?
  • RQ5该方法在其他网格重建任务(如手部网格重建)中具有多大程度的泛化能力?

主要发现

  • 与基线方法相比,TORE 在 Human3.6M 和 3DPW 基准上将 FLOPs 降低了高达 78%,同时保持或提升了准确率。
  • 在 Human3.6M 上,TORE 实现了 36.4 mm 的 PAMPJPE 与 249.2 FPS 的吞吐量,优于 TCFormer 与 PPT,在速度与准确率上均表现更优。
  • 在 FastMETRO-Eb0 上,TORE 实现了 1.6 GFLOP 的模型大小与 870.4 FPS 的吞吐量,同时在吞吐量与 PAMPJPE 上均超越 PPT。
  • 自注意力可视化结果表明,关节与顶点学习到了非局部且鲁棒的交互关系,从而在遮挡与部分观测条件下提升了性能。
  • 20% 的剪枝率实现了最优权衡,PAMPJPE 为 43.9 mm;而更高的剪枝率(如 75%)虽进一步降低 FLOPs,但导致性能下降。
  • 在 3DPW 与 Human3.6M 上的定性结果表明,与 METRO、MeshGraphormer 和 FastMETRO 相比,TORE 在多样化姿态与视角下生成了更准确、更稳定的网格。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。