[论文解读] MobRecon: Mobile-Friendly Hand Mesh Reconstruction from Monocular Image
MobRecon 提出了一种面向移动设备优化的手部网格重建框架,结合轻量级堆叠2D编码、基于螺旋采样的深度可分离螺旋卷积(DSConv)用于3D解码,以及一种新颖的特征提升模块,该模块结合基于地图的位置回归与姿态到顶点的特征提升。该方法在 Apple A14 CPU 上实现了 83 FPS 的推理速度,仅需 123M 次乘加操作和 500 万个参数,同时在 FreiHAND 数据集上达到 5.7mm 的 PAMPJPE,性能达到当前最先进水平。
In this work, we propose a framework for single-view hand mesh reconstruction, which can simultaneously achieve high reconstruction accuracy, fast inference speed, and temporal coherence. Specifically, for 2D encoding, we propose lightweight yet effective stacked structures. Regarding 3D decoding, we provide an efficient graph operator, namely depth-separable spiral convolution. Moreover, we present a novel feature lifting module for bridging the gap between 2D and 3D representations. This module begins with a map-based position regression (MapReg) block to integrate the merits of both heatmap encoding and position regression paradigms for improved 2D accuracy and temporal coherence. Furthermore, MapReg is followed by pose pooling and pose-to-vertex lifting approaches, which transform 2D pose encodings to semantic features of 3D vertices. Overall, our hand reconstruction framework, called MobRecon, comprises affordable computational costs and miniature model size, which reaches a high inference speed of 83FPS on Apple A14 CPU. Extensive experiments on popular datasets such as FreiHAND, RHD, and HO3Dv2 demonstrate that our MobRecon achieves superior performance on reconstruction accuracy and temporal coherence. Our code is publicly available at https://github.com/SeanChenxy/HandMesh.
研究动机与目标
- 开发一种兼顾高精度、快速推理与时间一致性的移动端友好的手部网格重建系统。
- 通过设计轻量级的2D编码与3D解码组件,解决现有方法在移动平台上的效率低下问题。
- 通过新颖的特征提升模块,提升2D到3D特征映射的精度与时间一致性。
- 在不牺牲重建质量的前提下,实现在移动CPU上的实时性能(83 FPS)。
- 在移动设备约束条件下,于 FreiHAND、RHD 与 HO3Dv2 数据集上展示最先进性能。
提出的方法
- 提出受沙漏结构启发的轻量级堆叠2D编码结构,以提升效率与精度。
- 提出深度可分离螺旋卷积(DSConv),一种基于螺旋采样的新型图卷积算子,用于高效3D网格解码。
- 设计一种结合基于地图的位置回归(MapReg)、姿态池化与姿态到顶点特征提升(PVL)的特征提升模块,实现从2D姿态特征到3D顶点表示的映射。
- 采用混合2D姿态表示(MapReg),统一热力图与位置回归,以提升2D精度与时间一致性。
- 引入3D/2D一致性损失,进一步增强时间稳定性与性能表现。
- 在手部姿态与视角均匀分布的合成数据集上进行训练,以提升泛化能力。
实验结果
研究问题
- RQ1轻量级2D编码架构是否能在移动CPU上实现高精度的同时保持实时推理?
- RQ2如何在不损害重建质量的前提下,使3D网格解码更加高效?
- RQ3非序列化方法在手部网格重建中是否能比序列化模型实现更好的时间一致性?
- RQ4混合2D姿态表示(MapReg)在多大程度上能同时提升2D精度与3D重建一致性?
- RQ5统一的特征提升模块是否能在减小模型尺寸的同时提升3D顶点特征质量?
主要发现
- MobRecon 在 FreiHAND 数据集上实现了 5.7mm 的最先进 PAMPJPE 指标,超越了先前的 SOTA 方法。
- 该模型在 Apple A14 CPU 上以 83 FPS 的速度运行,仅需 123M 次乘加操作与 500 万个参数,支持实时移动端部署。
- DSConv 在减少3D解码器的乘加操作与参数量的同时,保持或提升了性能,优于 SpiralConv++。
- 基于 MapReg 的特征提升模块提升了2D姿态精度与时间一致性,从而显著改善了3D重建质量。
- 在存在遮挡的 HO3Dv2 难度数据集上,MobRecon 实现了 9.2mm 的 PJ 与 0.538 的 F@5,优于先前方法。
- 通过一致性学习,时间一致性显著提升,FreiHAND 数据集上 F@15 提升至 0.986。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。