[论文解读] CASA: Category-agnostic Skeletal Animal Reconstruction
CASA 提出了一种无需类别特定先验的单目视频类别无关骨骼动物重建方法:首先通过基于 CLIP 的视频到形状检索,从大型资产库中检索合适的 3D 角色模板,然后利用神经逆向图形框架联合优化形状、骨骼结构、皮肤权重和关节角度。该方法在 4D 重建中达到最先进性能,并可在无需类别特定先验的情况下实现多样化动物的真实感重动画化。
Recovering the skeletal shape of an animal from a monocular video is a longstanding challenge. Prevailing animal reconstruction methods often adopt a control-point driven animation model and optimize bone transforms individually without considering skeletal topology, yielding unsatisfactory shape and articulation. In contrast, humans can easily infer the articulation structure of an unknown animal by associating it with a seen articulated character in their memory. Inspired by this fact, we present CASA, a novel Category-Agnostic Skeletal Animal reconstruction method consisting of two major components: a video-to-shape retrieval process and a neural inverse graphics framework. During inference, CASA first retrieves an articulated shape from a 3D character assets bank so that the input video scores highly with the rendered image, according to a pretrained language-vision model. CASA then integrates the retrieved character into an inverse graphics framework and jointly infers the shape deformation, skeleton structure, and skinning weights through optimization. Experiments validate the efficacy of CASA regarding shape reconstruction and articulation. We further demonstrate that the resulting skeletal-animated characters can be used for re-animation.
研究动机与目标
- 解决在不依赖类别特定先验的情况下,从非约束单目视频重建 3D 骨骼动物的挑战。
- 克服现有方法中使用控制点或自由形式变形的局限性,这些方法无法生成可动画化且拓扑一致的骨骼。
- 开发一个可泛化的框架,能够处理包括未见物种在内的多样化动物类别,实现真实感的形状与运动。
- 构建一个大规模、真实的合成数据集 PlanetZoo,包含真实 3D 形状、骨骼和绑定信息,用于整体评估。
- 通过生成与标准动画工作流兼容的骨骼网格,支持下游重定向与动画。
提出的方法
- 通过预训练的 CLIP 模型,基于图文对齐技术,将输入视频与大型资产库中的 3D 角色进行匹配,实现视频到形状的检索。
- 检索得到的 3D 角色作为神经逆向图形框架的初始化,该框架联合优化形状变形、骨骼结构(骨骼长度与关节角度)以及皮肤权重。
- 优化框架整合了多种能量项:掩码一致性、光流一致性、对称性正则化与平滑性,以确保几何与时间的一致性。
- 采用可拉伸的骨骼变形模型,以在形变过程中保持整体形状一致性,避免局部不连续性。
- 方法采用可微分渲染流水线,将渲染图像与输入视频帧进行比较,实现端到端优化。
- 提出一种新颖的初始化策略,利用基于 CLIP 的检索,显著优于随机或 k-means 初始化,提升了重建质量。
实验结果
研究问题
- RQ1是否能够通过类别无关的方法,从非约束单目视频中重建出无需依赖类别特定先验或标注的真实 3D 骨骼动物?
- RQ2基于 CLIP 的视频到形状检索在跨多样化物种中初始化准确 3D 动物重建方面的有效性如何?
- RQ3与顶点级形变相比,引入可拉伸骨骼模型在多大程度上提升了形状与运动质量?
- RQ4不同优化组件(如光流、对称性、平滑性)对重建保真度与鲁棒性的贡献如何?
- RQ5重建的 3D 骨骼动物是否能够被有效重定向并动画化于新姿态?
主要发现
- CASA 在合成数据集 PlanetZoo 和真实世界 DAVIS 数据集上均达到最先进性能,平均 IOU 为 0.512,平均 Chamfer 距离为 0.053。
- 消融研究显示,移除掩码一致性项会显著降低性能,表明其在形状重建中的关键作用。
- 使用 CLIP 进行检索的性能显著优于基于 ImageNet 的检索(mIOU:0.512 vs. 0.111),证明语义对齐的重要性。
- 引入可拉伸骨骼形变可减少鼻部与口部等区域的视觉伪影,提升几何一致性。
- 检索初始化至关重要——采用 k-means 或固定皮肤权重初始化会导致性能显著下降(mIOU:0.305–0.433)。
- 重建的 3D 角色具备可动画性,可成功重定向至新姿态,证明其在下游动画任务中的实际应用价值。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。