[论文解读] ConRF: Zero-shot Stylization of 3D Scenes with Conditioned Radiation Fields
ConRF 通过将 CLIP 特征映射到基于 VGG 的风格空间并采用 3D 体素选择体实现局部化风格迁移,无需微调即可实现零样本 3D 场景风格迁移,实现了最先进的视觉质量和视图一致性。
Most of the existing works on arbitrary 3D NeRF style transfer required retraining on each single style condition. This work aims to achieve zero-shot controlled stylization in 3D scenes utilizing text or visual input as conditioning factors. We introduce ConRF, a novel method of zero-shot stylization. Specifically, due to the ambiguity of CLIP features, we employ a conversion process that maps the CLIP feature space to the style space of a pre-trained VGG network and then refine the CLIP multi-modal knowledge into a style transfer neural radiation field. Additionally, we use a 3D volumetric representation to perform local style transfer. By combining these operations, ConRF offers the capability to utilize either text or images as references, resulting in the generation of sequences with novel views enhanced by global or local stylization. Our experiment demonstrates that ConRF outperforms other existing methods for 3D scene and single-text stylization in terms of visual quality.
研究动机与目标
- 解决现有 3D 风格迁移方法在每种新风格下都需要微调的局限性。
- 通过文本或图像参考作为条件因子,实现 3D 场景的零样本风格迁移。
- 通过将 CLIP 特征映射到基于 VGG 的风格空间,克服 CLIP 特征在捕捉艺术风格时的模糊性。
- 引入 3D 体素选择机制,实现仅通过文本提示进行的局部化风格迁移。
- 在不为每种风格微调模型的前提下,实现高保真且一致的跨新视角风格迁移。
提出的方法
- 使用 CLIP 的文本和图像编码器,从文本提示或参考图像中提取特征。
- 训练一个映射网络,将 CLIP 特征投影到 VGG 特征空间,以减少风格表征中的模糊性。
- 将映射后的风格特征集成到神经辐射场中,实现 3D 场景的全局风格迁移。
- 引入具有多尺度空间特征提取的 3D 选择体,基于文本提示实现风格迁移的局部化。
- 在训练过程中应用风格特征损失和一致性损失,以保持风格保真度和视图一致性。
- 推理时使用 CLIP 的零样本图像-文本匹配,无需微调即可基于未见过的文本或图像参考进行条件控制。
实验结果
研究问题
- RQ1CLIP 特征能否被有效映射到基于 VGG 的风格空间,以实现零样本 3D 风格迁移?
- RQ2如何仅通过文本提示实现 3D 场景中的局部化风格迁移?
- RQ3映射网络和损失组件对风格迁移质量和一致性的影响如何?
- RQ4该方法能否在不微调的情况下泛化到未见过的文本或图像参考?
- RQ53D 选择体如何实现对局部风格应用的细粒度控制?
主要发现
- 与基线方法 StyleRF 相比,ConRF 在短距离 LPIPS 上提升 31%,在长距离 LPIPS 上提升 59.4%,表明视图一致性更优。
- 在基于文本的风格迁移中,该方法优于 CLIPStyler 和 CLIP-NeRF,展现出与文本风格描述更好的对齐性。
- 消融研究证实,若移除映射模块,风格迁移性能会严重下降,凸显其必要性。
- 一致性损失显著提升了风格迁移质量,而风格特征损失则增强了对参考风格的保真度。
- 在多尺度空间特征提取策略中,窗口大小为 32 时,生成的掩码最清晰、最准确,适用于局部风格迁移。
- 局限性包括对图像中文字风格(如蓝色文字)处理不佳,以及当前局部风格迁移仅限于面向正面的场景。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。