[论文解读] Sketch2Model: View-Aware 3D Modeling from Single Free-Hand Sketches
本文提出Sketch2Model,一种视图感知的3D重建方法,通过显式地将生成过程基于预测或用户指定的视角进行条件控制,从单张手绘草图生成高质量的3D网格。通过解耦视图与形状特征,并采用随机视图增强训练,该模型减少了草图理解中的歧义,实现了更优的重建质量与用户意图对齐,尤其在绘制质量较差的草图上表现突出。
We investigate the problem of generating 3D meshes from single free-hand sketches, aiming at fast 3D modeling for novice users. It can be regarded as a single-view reconstruction problem, but with unique challenges, brought by the variation and conciseness of sketches. Ambiguities in poorly-drawn sketches could make it hard to determine how the sketched object is posed. In this paper, we address the importance of viewpoint specification for overcoming such ambiguities, and propose a novel view-aware generation approach. By explicitly conditioning the generation process on a given viewpoint, our method can generate plausible shapes automatically with predicted viewpoints, or with specified viewpoints to help users better express their intentions. Extensive evaluations on various datasets demonstrate the effectiveness of our view-aware design in solving sketch ambiguities and improving reconstruction quality.
研究动机与目标
- 通过仅使用单张手绘草图,为新手用户提供快速、直观的3D建模能力。
- 解决因绘图质量差、几何失真及视觉线索缺失导致的草图驱动3D重建中的歧义问题。
- 通过显式地将生成过程基于视角信息进行条件控制,提升重建质量与用户意图的一致性。
- 开发一种能良好泛化至分布外草图(包括真实世界手绘输入)的方法。
- 通过领域自适应,弥合合成训练草图与真实世界手绘草图之间的领域差距。
提出的方法
- 该方法采用解耦编码器-解码器架构,将潜在特征分离为视图码与形状码。
- 训练视图自编码器,将视角映射至潜在视图空间,以确保视图码中仅编码视角信息。
- 引入随机视图增强训练,即在训练过程中向解码器同时输入真实视图与随机采样的视图,以强制实现视图条件化的生成。
- 使用形状判别器以提升生成3D网格的真实感与结构保真度。
- 应用多尺度渐进式训练以稳定训练过程并提升生成质量。
- 通过领域判别器应用领域自适应,将合成训练草图与来自Sketchy和Tu-Berlin等数据集的真实手绘草图对齐。

实验结果
研究问题
- RQ1视角指定是否能显著降低从单张手绘草图进行3D重建时的歧义?
- RQ2将生成过程基于视角进行条件控制,如何提升重建质量与用户意图对齐?
- RQ3视图感知架构在真实世界中绘制质量较差、训练时未见的草图上,其泛化能力如何?
- RQ4在从合成草图学习视图条件化3D生成时,哪种训练策略最为有效?
- RQ5领域自适应在弥合合成草图与真实手绘草图之间的差距方面效果如何?
主要发现
- 在ShapeNet-Synthetic数据集上,Sketch2Model在使用真实视角时的体素IoU得分高于基线方法,证明了视角条件控制的重要性。
- 消融实验表明,随机视图增强训练与形状判别器在预测视角与真实视角上均显著提升了性能。
- 通过领域自适应,Sketch2Model在真实世界ShapeNet-Sketch数据集上的性能显著提升,尤其在飞机、汽车与沙发类别上表现突出。
- 在Sketchy与Tu-Berlin数据集上的定性结果表明,Sketch2Model生成的网格与输入草图边界对齐更好,且更具真实感。
- 即使对于分布外形状(如失真的飞机与桌子),该方法也能有效平衡草图对齐与形状真实感。
- 投影轮廓对比结果证实,视图感知生成相比视图无关方法能实现更准确的草图到网格对应关系。
![Figure 2: Network architecture of (a) baseline methods [ 20 , 22 ] and (b) our method. Purple and blue blocks denote inputs and trainable parameters respectively. $\mathcal{R}$ is the differentiable rendering module. Our method extends the encoder-decoder model by decomposing image features into sha](https://ar5iv.labs.arxiv.org/html/2105.06663/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。