[论文解读] PeRFception: Perception using Radiance Fields
本文提出了PeRFception,这是首个基于Plenoxels的大规模隐式3D表示数据集——一种压缩的、逼真的辐射场,以统一且内存高效的格式同时编码2D与3D信息。作者展示了直接在该隐式表示上进行端到端训练分类与分割模型,实现了最先进的性能,内存压缩率达96.4%,并提出了新颖的背景增强技术。
The recent progress in implicit 3D representation, i.e., Neural Radiance Fields (NeRFs), has made accurate and photorealistic 3D reconstruction possible in a differentiable manner. This new representation can effectively convey the information of hundreds of high-resolution images in one compact format and allows photorealistic synthesis of novel views. In this work, using the variant of NeRF called Plenoxels, we create the first large-scale implicit representation datasets for perception tasks, called the PeRFception, which consists of two parts that incorporate both object-centric and scene-centric scans for classification and segmentation. It shows a significant memory compression rate (96.4\%) from the original dataset, while containing both 2D and 3D information in a unified form. We construct the classification and segmentation models that directly take as input this implicit format and also propose a novel augmentation technique to avoid overfitting on backgrounds of images. The code and data are publicly available in https://postech-cvlab.github.io/PeRFception .
研究动机与目标
- 解决在NeRF等隐式3D表示上训练感知模型时缺乏大规模数据集的问题。
- 克服NeRF在速度、特征一致性及可迁移性方面用于感知任务的局限性。
- 实现在下游感知任务(如分类与分割)中直接处理隐式表示(通过Plenoxels)。
- 开发一种统一、紧凑且一致的特征表示,同时保留几何与逼真视觉信息。
- 提出一种新颖的背景增强策略,以减轻隐式表示中的过拟合问题。
提出的方法
- 使用可微体素渲染将两个大规模3D数据集——CO3D与ScanNet——转换为基于Plenoxel的隐式表示。
- 利用球谐系数与稀疏体素网格编码视图相关的辐射场与几何信息,实现场景间一致且结构化的特征。
- 应用数据压缩技术,将Plenoxel大小减少96.4%,同时保持高保真重建与感知性能。
- 设计一种新颖的增强方法,在训练期间操纵背景视图,以提升泛化能力并减少过拟合。
- 直接在隐式Plenoxel格式上端到端训练2D图像分类、3D物体分类与3D语义分割模型。
- 利用显式的稀疏体素网格加速推理并实现相比标准NeRF的高效特征提取。
实验结果
研究问题
- RQ1像Plenoxels这样的隐式3D表示能否有效用作多样化感知任务的统一输入格式?
- RQ2Plenoxel表示的内存压缩在多大程度上影响下游感知性能?
- RQ3在隐式空间中进行背景增强在多大程度上提升了分类与分割模型的泛化能力?
- RQ4直接在隐式表示上进行端到端训练的模型能否在准确性上与使用显式3D输入的模型相媲美?
- RQ5Plenoxels中的结构化特征表示在多大程度上支持不同场景间的一致且可迁移的感知?
主要发现
- PeRFception数据集相比原始数据集实现了96.4%的内存压缩率,同时保持了逼真的渲染质量与3D几何保真度。
- 在PeRFception-CO3D上直接训练的分类模型在14A设置下达到85.3%的top-1准确率,在最佳增强设置下34C设置的准确率为46.6%。
- 在PeRFception-ScanNet上训练的语义分割模型在34C设置下达到92.7%的平均IoU,表明其在复杂室内场景中具有强大的泛化能力。
- 所提出的背景增强技术显著提升了模型鲁棒性,将某些类别的过拟合现象减少,并使准确率最高提升4.5%。
- 在隐式表示上进行端到端训练在2D与3D感知任务中均取得了具有竞争力的性能,验证了直接处理隐式输入的可行性。
- 可视化结果证实了高保真度的新视角合成与准确的语义标注,误差图中PSNR值超过30,表明重建质量优异。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。