Skip to main content
QUICK REVIEW

[论文解读] Is Attention All That NeRF Needs?

Mukund Varma T, Peihao Wang|arXiv (Cornell University)|Jul 27, 2022
Advanced Vision and Imaging被引用 6
一句话总结

本文提出通用神经辐射场变换器(GNT),一种基于Transformer的架构,可在无需显式渲染方程的情况下重建神经辐射场并渲染新视角。通过使用几何感知的视图变换器进行特征聚合,以及使用射线变换器进行基于注意力的渲染,GNT在未见场景上实现了最先进性能,在跨场景泛化方面平均优于先前方法约10%,并通过注意力机制隐式学习到物理上合理的深度与遮挡感知能力。

ABSTRACT

We present Generalizable NeRF Transformer (GNT), a transformer-based architecture that reconstructs Neural Radiance Fields (NeRFs) and learns to renders novel views on the fly from source views. While prior works on NeRFs optimize a scene representation by inverting a handcrafted rendering equation, GNT achieves neural representation and rendering that generalizes across scenes using transformers at two stages. (1) The view transformer leverages multi-view geometry as an inductive bias for attention-based scene representation, and predicts coordinate-aligned features by aggregating information from epipolar lines on the neighboring views. (2) The ray transformer renders novel views using attention to decode the features from the view transformer along the sampled points during ray marching. Our experiments demonstrate that when optimized on a single scene, GNT can successfully reconstruct NeRF without an explicit rendering formula due to the learned ray renderer. When trained on multiple scenes, GNT consistently achieves state-of-the-art performance when transferring to unseen scenes and outperform all other methods by ~10% on average. Our analysis of the learned attention maps to infer depth and occlusion indicate that attention enables learning a physically-grounded rendering. Our results show the promise of transformers as a universal modeling tool for graphics. Please refer to our project page for video results: https://vita-group.github.io/GNT/.

研究动机与目标

  • 为解决NeRF的单场景优化局限性及其在场景间泛化能力差的问题,实现可迁移的端到端新视角合成。
  • 将NeRF中手工设计的体素渲染方程替换为可学习的、基于注意力的渲染机制。
  • 探究Transformer是否可作为3D场景表征与渲染的通用可微分聚合函数。
  • 分析GNT中的注意力机制是否隐式学习到深度与遮挡线索,从而实现物理上合理的渲染。
  • 证明当采用基于注意力的学习时,显式的3D几何归纳偏差或固定渲染公式不再是必需。

提出的方法

  • 视图变换器利用对极几何作为归纳偏差,通过沿对极线关注像素来聚合多视角图像特征,预测坐标对齐的特征。
  • 视图变换器采用U-Net主干网络提取多尺度特征,随后通过Transformer编码器利用自注意力机制执行跨视角特征匹配。
  • 射线变换器通过交叉注意力机制,在追踪的射线上解码坐标对齐的特征,学习渲染新视角颜色,而无需固定渲染公式。
  • 射线变换器关注射线上的点,注意力权重隐式建模可见性与深度,实现自适应场景的渲染。
  • 模型在源视角上端到端训练,无需单场景微调,从而实现在未见场景上的零样本推理。
  • 该架构完全可微,支持通过标准反向传播进行优化,无需显式几何监督。

实验结果

研究问题

  • RQ1基于Transformer的架构是否能在保持或提升渲染质量的同时,替代NeRF中的显式体素渲染方程?
  • RQ2注意力机制在无显式监督或几何先验的情况下,能在多大程度上学习到深度与遮挡感知能力?
  • RQ3单个GNT模型是否能在无需微调或重训练的情况下,泛化到多样化的未见场景?
  • RQ4与经典代价体积或特征聚合方法相比,GNT中的注意力机制在建模反射、阴影等物理现象方面表现如何?
  • RQ5在视图变换器中使用对极几何作为归纳偏差,是否相比无几何感知的方法能提升特征对齐与泛化能力?

主要发现

  • GNT在跨场景泛化任务中达到最先进性能,在多个基准测试中平均优于所有先前方法约10%。
  • 在LLFF数据集上,GNT的PSNR为0.963,SSIM为0.846,LPIPS为0.055,优于NeRF及其他SOTA方法。
  • 射线变换器中的注意力图与深度和遮挡具有强相关性,表明GNT隐式学习到了物理上合理的渲染。
  • 定性结果表明,GNT即使在无显式光传输建模的情况下,也能有效模拟复杂的光照效应,如反射与阴影。
  • 该模型在未见场景上泛化良好,包括具有复杂几何与外观的场景,且无需单场景适配。
  • 尽管性能优异,边界像素处仍出现轻微伪影,原因在于缺少对极对应关系,表明在处理边界情况时存在局限性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。