[论文解读] Federated Learning for Large-Scale Scene Modeling with Neural Radiance Fields
本文提出了一种用于大规模场景建模的联邦学习流水线,采用神经辐射场(NeRF),实现在车辆和无人机之间的去中心化、隐私保护式训练。通过将本地NeRF输出缓存为3D体素网格,并利用可微渲染对齐客户端位姿,该方法实现了通信和内存成本更低的可扩展、可维护的全局NeRF更新,在每个客户端本地数据有限的情况下,于Mill19数据集上仍取得了具有竞争力的性能。
We envision a system to continuously build and maintain a map based on earth-scale neural radiance fields (NeRF) using data collected from vehicles and drones in a lifelong learning manner. However, existing large-scale modeling by NeRF has problems in terms of scalability and maintainability when modeling earth-scale environments. Therefore, to address these problems, we propose a federated learning pipeline for large-scale modeling with NeRF. We tailor the model aggregation pipeline in federated learning for NeRF, thereby allowing local updates of NeRF. In the aggregation step, the accuracy of the clients' global pose is critical. Thus, we also propose global pose alignment to align the noisy global pose of clients before the aggregation step. In experiments, we show the effectiveness of the proposed pose alignment and the federated learning pipeline on the large-scale scene dataset, Mill19.
研究动机与目标
- 为利用车辆和无人机的去中心化数据,解决基于NeRF的大规模地球尺度场景建模中的可扩展性与可维护性问题。
- 克服集中式NeRF训练流水线在大环境下的高通信、存储与计算成本。
- 通过允许本地模型更新而无需数据集中化,实现地图的终身、持续维护。
- 通过支持局部化全局模型更新,缓解大规模NeRF地图中的遗忘问题。
- 通过新颖的位姿对齐步骤,提升对客户端设备传感器误差导致的噪声全局位姿的鲁棒性。
提出的方法
- 全局NeRF模型以3D体素网格表示,通过聚合本地NeRF模型的输出实现本地更新。
- 本地NeRF模型在客户端数据上进行训练,其输出在传输至服务器前被缓存为体素化特征网格。
- 新颖的全局位姿对齐步骤通过最小化全局与本地模型渲染的RGB和深度图像之间的差异,校正噪声较大的客户端位姿。
- 聚合过程利用全局坐标系中的客户端位姿组合缓存的体素输出,保持空间一致性。
- 该方法避免从头开始重新训练全局模型,并在本地建模区域之外保持模型完整性。
- 该流水线通过支持无需完整重训的增量更新,实现持续学习。

实验结果
研究问题
- RQ1联邦学习能否被有效适配用于训练大规模NeRF模型,同时保护数据隐私并降低通信开销?
- RQ2如何校正移动设备和无人机传感器产生的不准确全局位姿,以确保本地NeRF模型的准确聚合?
- RQ3在联邦设置下,本地数据稀疏性与视角限制对全局NeRF模型质量有何影响?
- RQ4与端到端模型聚合相比,本地模型输出的体素缓存方式在渲染质量与计算效率方面表现如何?
- RQ5所提出的方法在地球尺度环境下的可扩展性与可维护性是否优于集中式或分布式NeRF训练?
主要发现
- 所提出的联邦学习流水线通过仅传输0.1 GB的模型权重而非每客户端高达1 GB的原始数据,显著降低了通信与内存成本。
- 全局位姿对齐显著提升了渲染质量,通过校正噪声较大的客户端位姿,PSNR指标与视觉保真度均得到改善。
- 该方法通过直接采样缓存的体素网格而非通过MLP重新计算,实现了比基线方法与分布式训练更快的渲染速度。
- 由于本地数据有限及体素缓存中的量化误差,所提方法的PSNR低于完整基线,尤其在高频建筑场景中表现更差。
- 在低频碎石场景中,由于量化误差减少,所提方法优于分布式训练,展现出在适宜环境下的鲁棒性。
- 该方法实现了可扩展、隐私保护且可维护的大规模NeRF地图构建,为终身、协作式场景建模奠定了基础。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。