[论文解读] Unsupervised Learning of Shape and Pose with Differentiable Point Clouds
该论文提出了一种无监督方法,通过可微分点云从单张图像中学习详细的3D形状和相机位姿。通过联合优化形状和位姿预测器,并利用多样化的位姿预测器集成进行知识蒸馏,该模型在无需真实位姿监督的情况下实现了高保真度的形状重建,优于基于体素的基线方法,并能自动发现语义对应关系。
We address the problem of learning accurate 3D shape and camera pose from a collection of unlabeled category-specific images. We train a convolutional network to predict both the shape and the pose from a single image by minimizing the reprojection error: given several views of an object, the projections of the predicted shapes to the predicted camera poses should match the provided views. To deal with pose ambiguity, we introduce an ensemble of pose predictors which we then distill to a single "student" model. To allow for efficient learning of high-fidelity shapes, we represent the shapes by point clouds and devise a formulation allowing for differentiable projection of these. Our experiments show that the distilled ensemble of pose predictors learns to estimate the pose accurately, while the point cloud representation allows to predict detailed shape models. The supplementary video can be found at https://www.youtube.com/watch?v=LuIGovKeo60
研究动机与目标
- 从无标注的2D图像中学习准确的3D形状和相机位姿,且无需真实相机位姿监督。
- 通过联合优化形状和位姿预测器,解决联合形状与位姿估计中的鸡肋问题。
- 通过训练多样化的位姿预测器集成,再通过知识蒸馏将其提炼为单一学生模型,以缓解位姿歧义和局部极小值问题。
- 通过用可微分点云表示替代低分辨率体素网格,实现高保真度的形状建模。
- 通过点云输出的结构自动发现不同物体实例之间的语义对应关系,无需显式监督。
提出的方法
- 将3D形状表示为点云而非体素,以实现高保真度、高效且以物体为中心的形状建模。
- 引入一种可微分投影算子,可从点云在预测相机位姿下渲染2D轮廓图、深度图或彩色图像。
- 通过最小化预测2D投影与输入图像之间的重投影误差,联合优化形状和位姿预测器。
- 使用位姿预测器的集成以缓解局部极小值和位姿歧义问题,随后通过知识蒸馏将其提炼为单一学生模型。
- 采用全连接解码器生成点云,从而在不同实例间实现隐式的语义对应关系。
- 利用点云输出的空间一致性,无需显式监督即可发现语义对应关系。
实验结果
研究问题
- RQ1仅使用2D监督且无真实位姿的情况下,能否从单张图像中准确恢复3D形状和相机位姿?
- RQ2在无监督学习下,可微分点云是否能实现优于基于体素方法的高保真度3D重建?
- RQ3与单模型训练相比,训练位姿预测器的集成并进行蒸馏是否能提升对位姿歧义的鲁棒性?
- RQ43D物体实例之间的语义对应关系是否能从点云表示中自动涌现,而无需显式监督?
- RQ5与现有无监督3D重建方法相比,该方法在定量和定性上表现如何?
主要发现
- 采用集成蒸馏的完整方法实现了7.1°的平均位姿误差,显著优于基线模型(9.0°),并接近使用真实位姿训练的模型性能(6.7°)。
- 点云表示支持细节丰富的形状建模,定性结果表明其能清晰呈现细长椅腿等精细结构,视觉保真度优于基于体素的方法(如MVC)。
- 语义对应关系被自动发现:图6中相同颜色的点代表不同椅子实例中相同的物体部件(如椅腿尖端、坐垫角落),且无需任何显式监督。
- 该方法在真实世界数据上泛化良好,因其不依赖精确的真实相机位姿,适用于从非结构化图像集合中进行学习。
- 消融实验证实,基于集成的方法对准确位姿估计至关重要,因为基线模型在面对歧义位姿时无法泛化。
- 可微分投影算子支持端到端训练,仅依赖2D监督,使2D深度学习技术(如感知损失和GAN)可直接应用于3D生成任务。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。