[论文解读] Not All Tokens Are Equal: Human-centric Visual Analysis via Token Clustering Transformer
本文提出Token Clustering Transformer(TCFormer),一种视觉Transformer模型,通过渐进式聚类动态生成形状和大小各异的token,对人身体区域聚焦更高分辨率,对背景则采用更粗粒度处理。TCFormer通过新颖的聚类token合并(CTM)模块和多阶段token聚合(MTA)头,在人体相关任务(如全身体姿态估计和3D网格重建)中实现最先进性能,有效保留了细节。
Vision transformers have achieved great successes in many computer vision tasks. Most methods generate vision tokens by splitting an image into a regular and fixed grid and treating each cell as a token. However, not all regions are equally important in human-centric vision tasks, e.g., the human body needs a fine representation with many tokens, while the image background can be modeled by a few tokens. To address this problem, we propose a novel Vision Transformer, called Token Clustering Transformer (TCFormer), which merges tokens by progressive clustering, where the tokens can be merged from different locations with flexible shapes and sizes. The tokens in TCFormer can not only focus on important areas but also adjust the token shapes to fit the semantic concept and adopt a fine resolution for regions containing critical details, which is beneficial to capturing detailed information. Extensive experiments show that TCFormer consistently outperforms its counterparts on different challenging human-centric tasks and datasets, including whole-body pose estimation on COCO-WholeBody and 3D human mesh reconstruction on 3DPW. Code is available at https://github.com/zengwang430521/TCFormer.git
研究动机与目标
- 为解决固定网格视觉Transformer对所有图像区域一视同仁、忽视语义重要性的局限性。
- 使视觉Transformer能够为关键人体区域(如面部和手部)分配更多token,同时减少对背景区域的token数量。
- 开发一种动态token生成机制,根据语义内容和任务需求自适应调整token的形状、大小和位置。
- 在多阶段特征聚合过程中保留高分辨率细节,同时不损失空间保真度。
- 在COCO-WholeBody和3DPW等人体视觉基准上实现卓越性能。
提出的方法
- TCFormer在第一阶段将每个像素初始化为一个视觉token,每个token代表一个单像素区域。
- 采用基于k近邻的密度峰值聚类(KNN-DPC)算法,根据特征将相似的token分组。
- 同一簇内的token通过特征平均进行合并,合并后token的区域为其输入区域的并集。
- 将合并后的token输入Transformer模块进行特征聚合,实现对非矩形、不规则形状区域的长距离注意力建模。
- 多阶段token聚合(MTA)头逐步上采样后续阶段的token,并跨所有阶段聚合特征,以重建像素对齐的特征图。
- MTA头确保每个像素对应唯一一个token,避免在固定网格转换中因token重叠导致的特征损失。
实验结果
研究问题
- RQ1与固定网格token化相比,动态非均匀token生成是否能提升人体视觉任务的性能?
- RQ2视觉token的渐进式聚类在保留面部和手部等关键身体部位的细粒度细节方面有何影响?
- RQ3所提出的聚类token合并(CTM)模块相较于标准平均池化或固定网格方法,在特征表示上的增强程度如何?
- RQ4多阶段token聚合(MTA)头在多尺度特征融合过程中是否能有效保留空间细节?
- RQ5TCFormer能否根据任务需求自适应调整token分布,例如在面部关键点检测与手部关键点检测任务中?
主要发现
- 在COCO-WholeBody数据集上,TCFormer实现58.7 AP的全身体姿态估计性能,较基线提升2.1 AP。
- 在3DPW数据集上,TCFormer实现28.6的平均MPJPE用于3D人体网格重建,较基线提升1.8。
- CTM模块显著降低在细粒度区域的性能下降:使用粗粒度token时,手部AP仅下降5.6%,面部AP仅下降13.6%,表明其具备强大的细节保留能力。
- 若将MTA头替换为转置卷积头,足部关键点检测的AP下降4.0%,证明MTA在保留细节方面的有效性。
- 定性分析显示,TCFormer将细粒度token分配给高细节区域(如面部和手部),且token分布具有任务自适应性,如在面部与手部关键点检测任务中训练的模型表现所示。
- 该方法是首个将聚类技术用于动态视觉token生成的研究,实现了视觉Transformer中灵活、语义感知的token形状与大小。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。