[论文解读] LASSIE: Learning Articulated Shapes from Sparse Image Ensemble via 3D Part Discovery
LASSIE 提出了一种自监督框架,仅通过10至30张自然场景下的图像即可重建高质量的3D关节动物形态,无需任何2D/3D标注或预定义模板。它通过深度特征一致性与几何先验发现3D部件,实现了在最小用户输入下的最先进3D重建与部件发现性能。
Creating high-quality articulated 3D models of animals is challenging either via manual creation or using 3D scanning tools. Therefore, techniques to reconstruct articulated 3D objects from 2D images are crucial and highly useful. In this work, we propose a practical problem setting to estimate 3D pose and shape of animals given only a few (10-30) in-the-wild images of a particular animal species (say, horse). Contrary to existing works that rely on pre-defined template shapes, we do not assume any form of 2D or 3D ground-truth annotations, nor do we leverage any multi-view or temporal information. Moreover, each input image ensemble can contain animal instances with varying poses, backgrounds, illuminations, and textures. Our key insight is that 3D parts have much simpler shape compared to the overall animal and that they are robust w.r.t. animal pose articulations. Following these insights, we propose LASSIE, a novel optimization framework which discovers 3D parts in a self-supervised manner with minimal user intervention. A key driving force behind LASSIE is the enforcing of 2D-3D part consistency using self-supervisory deep features. Experiments on Pascal-Part and self-collected in-the-wild animal datasets demonstrate considerably better 3D reconstructions as well as both 2D and 3D part discovery compared to prior arts. Project page: chhankyao.github.io/lassie/
研究动机与目标
- 解决从稀疏、未标注的自然场景图像中重建详细3D关节动物形态的挑战,且无需预定义模板或实例级标注。
- 通过类别无关、基于骨骼的神经部件表示,实现在多种动物物种间的泛化能力。
- 发现语义与几何上一致的3D部件,且在姿态变化和外观变化下保持稳定。
- 开发一种自监督优化框架,利用深度特征与几何先验,强制实现2D-3D部件一致性。
- 通过显式的3D部件表示,支持纹理迁移、姿态迁移与动画等下游应用。
提出的方法
- 利用用户提供的通用3D骨架,该骨架定义部件连接关系,但不包含精确的几何形状或骨骼长度。
- 通过自监督优化发现3D部件,利用DINO-ViT特征强制实现2D-3D对应关系与图像间语义一致性。
- 通过约束优化后的3D部件位于由简单几何体(如球体、圆柱体)构成的潜在形状流形上来施加几何正则化。
- 在统一的可微分框架中联合优化共享的3D部件形状、实例特定的相机位姿、骨骼变换与表面纹理。
- 利用DINO-ViT生成的密集自监督特征指导部件发现,并在无真实标注的情况下强制实现轮廓与语义一致性。
- 采用可微分渲染管道将3D部件投影至2D图像空间,并通过特征匹配监督优化过程。
实验结果
研究问题
- RQ1能否仅通过10至30张未标注的自然场景图像,实现3D关节动物形态的重建,而无需任何2D或3D标注?
- RQ2视觉Transformer模型的自监督深度特征能否有效引导3D部件发现并强制实现2D-3D一致性?
- RQ3对简单3D几何体施加几何先验是否能提升重建部件的质量与真实感?
- RQ4所发现的3D部件表示能否支持高质量应用,如纹理迁移与姿态迁移?
- RQ5该方法在仅需最少用户输入的情况下,能否在多种多样的动物物种间实现良好泛化?
主要发现
- LASSIE 在Pascal-Part基准上实现了最先进的3D重建质量,优于以往所有方法,即使后者具有更强的监督信号。
- 与SCOPS和DINO聚类相比,该方法在2D部件分割IOU上表现更高,语义对齐更好且部件分离更清晰(例如,能准确区分四条腿)。
- 部件迁移评估显示,图像对之间的PCP(正确像素比例)较高,表明3D部件具有强一致性与可迁移性。
- 3D神经部件表示支持在不同动物类别间实现逼真的纹理迁移与姿态迁移,如图6所示。
- LASSIE 生成了高质量、几何上优化的3D形态,具备显式且可操作的部件,支持动画与编辑等应用。
- 该框架在仅需最少用户干预的情况下,能良好泛化至自采集的多种动物物种的自然场景图像集合。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。