[论文解读] Spectral Graphormer: Spectral Graph-based Transformer for Egocentric Two-Hand Reconstruction using Multi-View Color Images
本文提出Spectral Graphormer,一种基于Transformer的新框架,用于从多视角RGB图像实现高保真双人手重建,通过谱图卷积与软注意力多视角特征融合,生成具有延伸前臂的逼真、物理上合理的网格。该方法在合成数据和真实数据上均达到最先进性能,展现出强大的泛化能力及在AR/VR应用中的实时潜力。
We propose a novel transformer-based framework that reconstructs two high fidelity hands from multi-view RGB images. Unlike existing hand pose estimation methods, where one typically trains a deep network to regress hand model parameters from single RGB image, we consider a more challenging problem setting where we directly regress the absolute root poses of two-hands with extended forearm at high resolution from egocentric view. As existing datasets are either infeasible for egocentric viewpoints or lack background variations, we create a large-scale synthetic dataset with diverse scenarios and collect a real dataset from multi-calibrated camera setup to verify our proposed multi-view image feature fusion strategy. To make the reconstruction physically plausible, we propose two strategies: (i) a coarse-to-fine spectral graph convolution decoder to smoothen the meshes during upsampling and (ii) an optimisation-based refinement stage at inference to prevent self-penetrations. Through extensive quantitative and qualitative evaluations, we show that our framework is able to produce realistic two-hand reconstructions and demonstrate the generalisation of synthetic-trained models to real data, as well as real-time AR/VR applications.
研究动机与目标
- 解决缺乏适用于第一人称视角、多视角双人手重建且包含延伸前臂的合适数据集的问题。
- 开发一种深度学习框架,直接从多视角RGB图像回归双人手的绝对根位姿,避免依赖根关节对齐。
- 通过基于谱图的解码与基于优化的精炼,提升网格的真实感与物理合理性。
- 通过大规模合成数据集与真实多相机采集,实现从合成数据到真实世界数据的有效泛化。
- 通过高效的标记设计与参数压缩,降低模型复杂度与计算成本。
提出的方法
- 提出一种基于软注意力的多视角图像特征融合策略,生成区域特定特征,使模型尺寸减少35%,同时保留空间信息。
- 框架采用基于谱图的Transformer架构,将谱图理论中的图拉普拉斯特性融入Transformer编码器与解码器。
- 采用粗到细的谱图卷积解码器,在上采样过程中平滑网格,提升网格质量与细节保留。
- 在推理阶段应用基于优化的精炼阶段,防止自穿透并增强重建网格的物理合理性。
- 构建大规模合成数据集,包含多样化的第一人称视角、光照与背景,用于预训练模型,并通过真实多相机数据集进行评估。
- 通过逐步减少Transformer编码器中的顶点查询数($V'$),实现模型压缩,优先减少$V'$而非$C$,以最小化计算成本。
实验结果
研究问题
- RQ1基于Transformer的架构能否在第一人称设置下,从多视角RGB图像有效重建出具有延伸前臂的高分辨率双人手网格?
- RQ2与传统的拼接或池化方法相比,基于软注意力的多视角特征融合在性能与模型效率方面表现如何?
- RQ3在复杂遮挡与光照条件下,预训练于合成数据的模型在真实世界、野外图像上的泛化能力达到何种程度?
- RQ4不同谱滤波器(高斯、拉普拉斯、切比雪夫)对网格重建精度与计算效率有何影响?
- RQ5基于优化的精炼能否通过消除重建人手网格中的自穿透现象,显著提升物理合理性?
主要发现
- 基于软注意力的融合策略在减少35%模型尺寸的同时,实现所有融合方法中最低的手部重建误差(6.7 mm)。
- 切比雪夫谱滤波器($g_{cheb_3}$)在性能与效率之间达到最佳平衡,在合成数据集上实现1.38 mm的手部误差。
- 模型在真实世界数据上表现出有效的泛化能力,当使用冻结的预训练主干进行微调时,在真实数据集上实现1.38 mm的手部误差。
- 基于优化的精炼阶段显著提升了网格质量,定性结果表明,各类姿态下的自穿透现象均被有效纠正。
- 模型压缩实验表明,当使用EfficientNet-B0主干时,将$V'$从804降低至80,总参数量降至34.2M,同时保持6.89 mm的手部误差,展现出良好的可扩展性。
- 该框架实现了适合AR/VR应用的实时推理性能,经复杂、自遮挡及挑战性光照场景的定性结果验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。