[论文解读] Worldsheet: Wrapping the World in a 3D Sheet for View Synthesis from a Single Image
Worldsheet 提出了一种类别无关、端到端可微的单张 RGB 图像新视角合成方法,通过将可变形 3D 网格片贴合到由深度监督预测的场景几何结构上实现。该方法使用可微纹理采样与渲染技术,通过 2D 图像重建损失进行训练,在 Matterport、Replica 和 RealEstate10K 数据集上实现了最先进性能,适用于高分辨率的真实场景图像和大幅视角变化。
We present Worldsheet, a method for novel view synthesis using just a single RGB image as input. The main insight is that simply shrink-wrapping a planar mesh sheet onto the input image, consistent with the learned intermediate depth, captures underlying geometry sufficient to generate photorealistic unseen views with large viewpoint changes. To operationalize this, we propose a novel differentiable texture sampler that allows our wrapped mesh sheet to be textured and rendered differentiably into an image from a target viewpoint. Our approach is category-agnostic, end-to-end trainable without using any 3D supervision, and requires a single image at test time. We also explore a simple extension by stacking multiple layers of Worldsheets to better handle occlusions. Worldsheet consistently outperforms prior state-of-the-art methods on single-image view synthesis across several datasets. Furthermore, this simple idea captures novel views surprisingly well on a wide range of high-resolution in-the-wild images, converting them into navigable 3D pop-ups. Video results and code are available at https://worldsheet.github.io.
研究动机与目标
- 在推理时无需 3D 监督或多视角输入,实现从单张 RGB 图像进行新视角合成。
- 开发一种类别无关、端到端可训练的方法,通过多视角监督联合学习 3D 几何与纹理。
- 探索使用可变形网格片作为稀疏、可微的 3D 表示,用于场景重建与视角合成。
- 评估网格包裹技术在处理复杂场景、遮挡和大幅视角变化方面的有效性。
- 研究网格分辨率与多层网格片对视角合成质量的影响。
提出的方法
- 该方法通过预测的深度和 2D 网格偏移,将平面网格网格包裹到场景上,构建 Worldsheet,形成 3D 网格表示。
- 提出一种新型可微纹理采样器,将输入图像投影到 3D 网格几何结构上,支持纹理映射过程中的梯度计算。
- 使用可微渲染器从新视角渲染网格,训练过程仅通过 2D 图像重建损失进行监督。
- 通过网格拉普拉斯损失实现几何正则化,稳定变形过程并防止优化过程中出现不合理的网格畸变。
- 多层扩展通过堆叠多个独立的网格片,以建模深度不连续性并改善遮挡处理。
- 模型采用端到端训练,每组场景仅使用两组视角,推理时无需显式 3D 监督或真实深度监督。

实验结果
研究问题
- RQ1单个可变形 3D 网格片能否有效用于从单张输入图像重建场景几何并合成新视角?
- RQ2可微纹理采样与渲染在无 3D 监督的情况下,能否有效支持端到端训练?
- RQ3网格包裹方法是否能在包括户外场景、室内环境和艺术画作在内的多样化场景类别中实现泛化?
- RQ4多层 Worldsheets 是否能改善大视角变化下的遮挡建模与视差效应?
- RQ5网格分辨率与几何正则化如何影响合成视角的质量?
主要发现
- Worldsheet 在 Matterport3D、Replica 和 RealEstate10K 数据集上达到最先进性能,在 PSNR 和 LPIPS 指标上显著优于先前方法。
- 在 RealEstate10K 数据集上,该方法在 65×65 网格下实现 26.74 的 PSNR,显著优于 SynSin 及其他 SOTA 基线方法。
- 模型能从 960×960 分辨率的真实场景图像中生成高质量、逼真的新视角,即使在大幅视角变化下仍表现良好。
- 消融实验表明,网格拉普拉斯正则化对稳定变形至关重要,当正则化强度过高时性能会下降。
- 更高的网格分辨率(如 65×65)有助于提升细节捕捉与性能表现,但在高分辨率下网格偏移分量的影响较小。
- 多层 Worldsheets 在定性上改善了遮挡与视差效应的处理,尽管在标准指标上的定量增益较为有限。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。