Skip to main content
QUICK REVIEW

[论文解读] Learned Initializations for Optimizing Coordinate-Based Neural Representations

Matthew Tancik, Ben Mildenhall|arXiv (Cornell University)|Dec 3, 2020
3D Shape Modeling and Analysis参考文献 30被引用 15
一句话总结

本文提出通过元学习(如 MAML 或 Reptile)学习坐标神经网络的初始权重,以加速优化过程,并在表示图像、CT 扫描和 3D 形状等信号时提升泛化能力。通过在一类信号(如人脸或椅子)的分布上进行训练,所学习的初始化作为强先验,可实现更快的收敛速度,并在部分或单视角观测下获得更好的重建效果——在 3D 重建和视角合成任务中,PSNR 显著提升。

ABSTRACT

Coordinate-based neural representations have shown significant promise as an alternative to discrete, array-based representations for complex low dimensional signals. However, optimizing a coordinate-based network from randomly initialized weights for each new signal is inefficient. We propose applying standard meta-learning algorithms to learn the initial weight parameters for these fully-connected networks based on the underlying class of signals being represented (e.g., images of faces or 3D models of chairs). Despite requiring only a minor change in implementation, using these learned initial weights enables faster convergence during optimization and can serve as a strong prior over the signal class being modeled, resulting in better generalization when only partial observations of a given signal are available. We explore these benefits across a variety of tasks, including representing 2D images, reconstructing CT scans, and recovering 3D shapes and scenes from 2D image observations.

研究动机与目标

  • 为解决从随机权重开始优化坐标神经网络以适应每个新信号时效率低下的问题。
  • 在神经表示的测试时优化过程中,提升收敛速度与泛化能力。
  • 探究元学习得到的初始权重是否可作为特定类别信号(如人脸、椅子、CT 扫描)的强先验。
  • 在多种任务中评估该方法:图像表示、CT 扫描重建,以及从 2D 图像恢复 3D 形状。
  • 证明即使在元训练阶段每类仅使用一张参考图像,也能实现有效的初始化。

提出的方法

  • 应用基于优化的元学习方法(MAML 或 Reptile),从目标类别信号的元训练集学习初始网络权重 θ₀*。
  • 使用具有固定架构的标准坐标 MLP,其中输入为坐标(如图像的 (x,y)),输出为信号值(如 RGB 颜色)。
  • 在元训练过程中,对元训练集中的每个信号执行内层优化,以将 θ₀* 适应到该信号,随后通过外层元更新步骤更新 θ₀*。
  • 元学习完成后,保存优化后的 θ₀*,并在测试时优化新、未见过的同类信号时将其作为初始化。
  • 在 3D 重建任务中,使用简单的 NeRF 模型,并从学习到的初始化开始优化,以实现从单视角或多视角图像中重建形状。
  • 通过在保留视角或测试图像上的 PSNR 等指标评估性能,并与标准随机初始化进行比较。

实验结果

研究问题

  • RQ1元学习得到的初始权重是否能显著减少优化坐标神经表示所需的梯度步数?
  • RQ2当仅能获取信号的部分或单视角观测时,学习到的初始化是否能作为强先验,从而提升泛化能力?
  • RQ3当元训练仅使用每信号一张图像(如 SV Meta)与多视角图像(如 MV Meta)时,性能表现有何差异?
  • RQ4该方法是否能泛化到多种信号类型,包括 2D 图像、体素数据和 3D 场景?
  • RQ5即使测试时优化步骤数量极少,元学习初始化的优势是否依然存在?

主要发现

  • 使用元学习得到的初始权重(MV Meta)在单张图像 3D 重建任务中,椅子的 PSNR 达到 18.85,汽车为 22.80,台灯为 22.35,显著优于标准随机初始化(分别为 12.49、11.45、15.47)。
  • 即使在元训练阶段每对象仅使用一张参考图像(SV Meta),该方法在椅子上仍达到 16.54 的 PSNR,汽车为 22.10,台灯为 20.95,表明在极小数据量下仍具备强大泛化能力。
  • 在 Phototourism 数据集上,由于视角间外观不一致,元学习模型在 Trevi(PSNR 19.35)、Sacre Coeur(19.33)和 Brandenburg(19.11)上的表现优于使用测试时优化的标准 NeRF(PSNR 范围 17.14–17.77)。
  • 该方法使使用简单 NeRF 模型从单张图像成功恢复 3D 形状成为可能,而随机初始化的网络在相同条件下则失败。
  • Reptile 在 64 次内层步骤下优于等效于仅 1 次内层步骤的基线,表明展开元更新过程可提升性能。
  • 学习到的初始化显著改善了优化轨迹,减少了收敛时间并提升了重建质量,且无需修改网络架构或测试时优化过程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。