[论文解读] LERF: Language Embedded Radiance Fields
LERF 提出一种方法,将 CLIP 语言特征直接嵌入神经辐射场(NeRF)中,构建一个多尺度、三维连续的语言场,实现无需微调或区域提议的实时、像素对齐、零样本语言查询,适用于多样化的视觉与抽象概念。其关键贡献是实现了三维一致、视角对齐的相关性图生成系统,在真实场景的开放词汇定位任务中优于二维基线方法。
Humans describe the physical world using natural language to refer to specific 3D locations based on a vast range of properties: visual appearance, semantics, abstract associations, or actionable affordances. In this work we propose Language Embedded Radiance Fields (LERFs), a method for grounding language embeddings from off-the-shelf models like CLIP into NeRF, which enable these types of open-ended language queries in 3D. LERF learns a dense, multi-scale language field inside NeRF by volume rendering CLIP embeddings along training rays, supervising these embeddings across training views to provide multi-view consistency and smooth the underlying language field. After optimization, LERF can extract 3D relevancy maps for a broad range of language prompts interactively in real-time, which has potential use cases in robotics, understanding vision-language models, and interacting with 3D scenes. LERF enables pixel-aligned, zero-shot queries on the distilled 3D CLIP embeddings without relying on region proposals or masks, supporting long-tail open-vocabulary queries hierarchically across the volume. The project website can be found at https://lerf.io .
研究动机与目标
- 通过将语言嵌入直接嵌入 NeRF,实现对 3D 场景的开放式、自然语言交互。
- 通过将现成的 CLIP 嵌入整合到三维连续场中,克服 NeRF 缺乏语义信息的局限。
- 支持多样化的语言查询,包括抽象、视觉、长尾和基于文本的查询,而无需依赖数据集特定的微调或区域提议。
- 通过跨多视角和多尺度的 CLIP 嵌入体积渲染,实现多尺度、三维一致的相关性图。
- 通过自然语言实现对 3D 场景的实时交互式查询,对 NeRF 训练速度影响极小。
提出的方法
- LERF 优化一个三维语言场 $F_{\text{lang}}(x,y,z,s)$,将三维空间坐标和物理尺度 $s$ 映射到 CLIP 嵌入,实现多尺度语言定位。
- 在训练过程中,从每个训练视图的多尺度裁剪中提取 CLIP 嵌入,并通过与 NeRF 射线对齐的特征金字塔作为监督信号。
- 通过对比损失训练语言场,以最大化沿每条射线的预测与真实 CLIP 嵌入之间的余弦相似度。
- 通过共享瓶颈引入自监督 DINO 特征,以正则化语言场,提升平滑性和边界定义。
- 使用体积渲染沿射线聚合 CLIP 嵌入,渲染权重来源于 NeRF 密度场。
- 在推理阶段,将任意语言提示嵌入三维场,生成实时、三维连续的相关性图,用于交互式查询。
实验结果
研究问题
- RQ1能否在不进行微调或区域提议的情况下,有效将 CLIP 嵌入定位到 3D NeRF 中?
- RQ2与二维基线相比,三维中的多尺度语言场是否能在开放词汇查询中实现更优的定位与一致性?
- RQ3多尺度监督在提升语言嵌入对多样化查询(如抽象、长尾、视觉类)的泛化能力方面有何作用?
- RQ4引入 DINO 特征在多大程度上提升了 3D 相关性图的质量与清晰度?
- RQ5LERF 是否能实现在手持设备捕获的 3D 场景中,实时、零样本、像素对齐的语言查询?
主要发现
- LERF 实现了对多种语言查询(包括 'electricity' 等抽象概念和 'Waldo' 等长尾对象)的实时、交互式 3D 相关性图生成。
- LERF 在 3D 定位精度上优于二维开放词汇检测器 LSeg 和 OWL-ViT,尤其在长尾和细粒度查询上表现更优。
- 引入 DINO 监督显著提升了相关性图的平滑性与边界清晰度,尤其在低视角或复杂几何区域表现更佳。
- 多尺度训练至关重要:若移除多尺度监督,粗粒度(如 'espresso machine')和细粒度(如 'creamer pods')查询的性能均会下降。
- LERF 生成的 3D 相关性图在场景中保持视角一致性,定性结果表明其与语义和视觉线索高度对齐。
- 失败案例包括在视觉或语义相似对象上产生误激活(如 'zucchini' 激活其他绿色蔬菜)以及空间推理能力有限(如 'table' 仅在边缘激活)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。