[论文解读] PREF: Phasorial Embedding Fields for Compact Neural Representations
PREF提出了一种紧凑且高效的基于频率的神经表示方法,采用扩张的3D相位矢量体,将频率在二维平面上均匀分布,并沿一维轴进行扩张,通过混合FFT与局部插值方法加速傅里叶映射。该方法在2D图像泛化、3D SDF回归以及5D神经辐射场重建任务中均达到当前最优性能,相比先前基于频率的表示方法和混合表示方法,显著降低了内存占用并提升了鲁棒性。
We present an efficient frequency-based neural representation termed PREF: a shallow MLP augmented with a phasor volume that covers significant border spectra than previous Fourier feature mapping or Positional Encoding. At the core is our compact 3D phasor volume where frequencies distribute uniformly along a 2D plane and dilate along a 1D axis. To this end, we develop a tailored and efficient Fourier transform that combines both Fast Fourier transform and local interpolation to accelerate naïve Fourier mapping. We also introduce a Parsvel regularizer that stables frequency-based learning. In these ways, Our PREF reduces the costly MLP in the frequency-based representation, thereby significantly closing the efficiency gap between it and other hybrid representations, and improving its interpretability. Comprehensive experiments demonstrate that our PREF is able to capture high-frequency details while remaining compact and robust, including 2D image generalization, 3D signed distance function regression and 5D neural radiance field reconstruction.
研究动机与目标
- 为解决基于频率的神经表示在捕捉高频细节时效率低下且内存开销高的问题。
- 通过将模型容量转移至紧凑的相位矢量体,减少频率编码模型对大型昂贵MLP的依赖。
- 通过直接操控频率分量,提升神经场的可解释性与可控性。
- 弥合基于频率与混合神经表示(如密集网格、八叉树)之间的性能与效率差距。
- 通过一种新型的Parsvel正则化方法,类似于总变差正则化,稳定基于频率模型的训练。
提出的方法
- 提出一种3D相位矢量体,实现二维频率的均匀分布与一维扩张,高效覆盖完整频谱带宽。
- 引入一种混合傅里叶变换,结合快速傅里叶变换(FFT)与局部插值,加速原始傅里叶映射过程。
- 设计一种专用于相位层的Parsvel正则化方法,以稳定基于频率的学习过程,其原理类似于总变差正则化。
- 用浅层网络替代传统频率编码中的黑箱MLP,将大部分容量转移至相位矢量体,从而提升可解释性。
- 采用紧凑且结构化的频率布局,实现极低参数量下的高频细节恢复。
- 预先计算并存储变换后的特征,确保快速推理,尽管训练阶段因FFT引入了额外开销。
实验结果
研究问题
- RQ1具有非均匀频率分布的紧凑相位矢量体是否能优于标准均匀傅里叶编码,在捕捉高频细节方面表现更优?
- RQ2如何在不损失频谱覆盖范围的前提下,降低基于频率的神经表示中傅里叶映射的计算成本?
- RQ3相位矢量体在多大程度上可以替代神经表示中的MLP,同时保持或提升性能?
- RQ4为相位层量身定制的正则化方法是否能提升基于频率模型的训练稳定性和泛化能力?
- RQ5当支持直接编辑频率分量时,基于频率表示的可解释性与混合表示相比如何?
主要发现
- PREF在2D图像泛化任务中达到当前最优性能,在自然图像上的PSNR为24.113 ± 3.464,在文字图像上的PSNR为28.329 ± 2.373,优于PE、SIREN与NGP。
- 在3D符号距离函数(SDF)回归任务中,PREF取得31.86的PSNR,略高于密集网格基线方法(31.02),且仅使用545 KB内存。
- 在5D神经辐射场重建任务中,PREF实现了高质量的新视角合成,内存占用更低,视觉保真度优于NeRF与NGP。
- Parsvel正则化方法稳定了基于频率模型的训练,实现了在多种任务中的一致收敛与强鲁棒性。
- 相位矢量体支持对神经场进行直接、可解释的编辑——例如,细节层级过滤——展示了对黑箱MLP的更强可控性。
- PREF将内存占用降低至545 KB,同时保持了具有竞争力的性能,显著优于PE(1318 KB)与SIREN(777 KB),并接近NGP(696 KB)的水平,且泛化能力更优。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。