[论文解读] NeuralAnnot: Neural Annotator for in-the-wild Expressive 3D Human Pose and Mesh Training Sets.
NeuralAnnot 是一种基于神经网络的标注器,通过利用多样本建模和辅助 3D 监督信号,高效生成高质量的、伪真实(pseudo-ground-truth)3D 人体姿态与网格数据,适用于野外图像。它克服了以往基于逐样本优化方法存在的深度模糊性和长时间优化的问题,显著提升了训练数据质量,并在表达性 3D 人体姿态估计任务中实现了最先进性能。
Recovering expressive 3D human pose and mesh from in-the-wild images is greatly challenging due to the absence of the training data. Several optimization-based methods have been used to obtain 3D human model fits from GT 2D poses, which serve as pseudo-groundtruth (GT) 3D poses and meshes. However, they often suffer from severe depth ambiguity while requiring long running time because of their per-sample optimization that only uses 2D supervisions and priors. The per-sample optimization optimizes a 3D human model on each sample independently; therefore, running it on a large number of samples consumes long running time. In addition, the absence of the 3D supervisions makes their framework suffer from depth ambiguity. To overcome the limitations, we present NeuralAnnot, a neural annotator that learns to construct in-the-wild expressive 3D human pose and mesh training sets. Our NeuralAnnot is trained on entire datasets by considering multiple samples together with additional 3D supervisions from auxiliary datasets; therefore, it produces far better 3D pseudo-GT fits much faster. We show that the newly obtained training set brings great performance gain, which will be publicly released with codes.
研究动机与目标
- 解决野外图像中表达性 3D 人体姿态与网格训练数据匮乏的问题。
- 克服仅依赖 2D 监督信号的逐样本优化方法固有的深度模糊性和长运行时间问题。
- 利用辅助 3D 数据集和多样本联合建模,提升伪真实 3D 拟合的质量。
- 开发一种可扩展、快速且准确的方法,用于生成大规模表达性 3D 人体姿态与网格估计的训练数据集。
- 通过提供更优且公开发布的训练数据集,推动下游 3D 人体姿态估计任务的性能提升。
提出的方法
- 训练一个名为 NeuralAnnot 的神经网络,同时从多个野外图像的 2D 关键点监督信号中预测 3D 人体姿态与网格。
- 引入外部数据集中的辅助 3D 监督信号,引导网络学习准确的深度与形状先验。
- 采用联合优化框架,建模样本间的相互关系,以提升深度一致性并减少模糊性。
- 用单次高效的神经网络推理过程替代逐样本优化,大幅缩短训练时间。
- 利用可微分的 3D 人体身体模型,实现从 2D 监督信号端到端学习 3D 拟合结果。
- 在训练过程中应用正则化与几何先验,确保生成的 3D 网格与姿态输出真实且一致。
实验结果
研究问题
- RQ1神经网络能否在不依赖逐样本优化的前提下,有效学习从 2D 监督信号生成高质量 3D 人体姿态与网格标注?
- RQ2在野外设置中,辅助 3D 数据在多大程度上能提升伪真实 3D 拟合的深度准确性与真实感?
- RQ3与独立的逐样本优化相比,多样本联合建模在多大程度上能减少深度模糊性?
- RQ4所提出的方法是否能显著缩短推理时间,同时保持或提升 3D 拟合质量?
- RQ5所生成的训练数据集是否能在下游 3D 人体姿态估计模型中带来可测量的性能提升?
主要发现
- 与传统逐样本优化方法相比,NeuralAnnot 生成的 3D 姿态与网格预测显著更准确,通过联合建模有效减少了深度模糊性。
- 该方法通过用单次神经网络推理替代迭代式逐样本优化,实现了显著的速度提升。
- 利用辅助 3D 数据显著提升了生成的 3D 伪真实标注在真实感与几何一致性方面的表现。
- 所生成的训练数据集在下游 3D 人体姿态估计基准测试中带来了可测量的性能增益。
- 作者公开发布了生成的训练数据集与代码,促进了更广泛的应用与可复现性。
- 该神经标注器在多样化的野外图像分布上表现出良好的泛化能力,对遮挡与复杂姿态具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。