[论文解读] Spline Positional Encoding for Learning 3D Implicit Signed Distance Fields
本文提出Spline Positional Encoding(Spe),一种可学习的位置编码方法,通过可训练的B样条函数将3D坐标映射到高维空间,显著提升了MLP从无组织点云中重建细粒度3D符号距离场(SDF)的能力。Spe在SDF重建质量上优于傅里叶位置编码和SIREN,并在图像重建任务中展现出良好的泛化能力。
Multilayer perceptrons (MLPs) have been successfully used to represent 3D shapes implicitly and compactly, by mapping 3D coordinates to the corresponding signed distance values or occupancy values. In this paper, we propose a novel positional encoding scheme, called Spline Positional Encoding, to map the input coordinates to a high dimensional space before passing them to MLPs, for helping to recover 3D signed distance fields with fine-scale geometric details from unorganized 3D point clouds. We verified the superiority of our approach over other positional encoding schemes on tasks of 3D shape reconstruction from input point clouds and shape space learning. The efficacy of our approach extended to image reconstruction is also demonstrated and evaluated.
研究动机与目标
- 解决基于坐标的MLP在从无组织点云训练时难以捕捉3D符号距离场(SDF)中高频几何细节的局限性。
- 克服ReLU激活MLP的谱偏差问题,尽管其低频拟合能力强,但难以恢复高频细节。
- 开发一种比固定正弦函数(如傅里叶位置编码)更具表现力和可学习性的位置编码,以增强MLP的表征能力。
- 通过基于分层样条细化的多尺度训练方案,实现SDF的鲁棒且渐进式的学习。
- 证明所提方法在3D形状重建之外的泛化能力,包括在2D图像重建任务中的应用。
提出的方法
- 提出Spline Positional Encoding(Spe),利用具有均匀节点的可训练B样条基函数,将输入3D坐标投影到高维空间。
- 将位置编码定义为B样条基函数的加权和,其中权重为可学习参数,从而实现自适应且富有表现力的特征映射。
- 采用多尺度训练策略,逐步细化样条分辨率,使网络能够收敛至更优的局部极小值,并逐步恢复精细细节。
- 将Spe作为MLP之前的预处理层,替代固定的编码方式(如傅里叶或正弦编码),以提升网络对复杂、高频SDF的建模能力。
- 通过SDF值上的L1损失与Eikonal正则化联合训练MLP,以强制|∇F(x)| ≈ 1,确保输出为有效SDF。
- 将方法扩展至图像重建任务,将Spe应用于2D坐标,使用L2损失和PSNR作为评估指标。
实验结果
研究问题
- RQ1基于B样条的可学习位置编码是否能在从原始点云重建3D SDF的高频细节方面优于固定的正弦函数编码(如傅里叶编码)?
- RQ2所提出的Spline Positional Encoding(Spe)是否能提升MLP在单形状与形状空间学习场景下的泛化性与鲁棒性?
- RQ3基于分层样条细化的多尺度训练方案如何影响收敛速度与重建质量?
- RQ4Spe是否能有效泛化至3D SDF学习之外的连续表示任务,如2D图像重建?
- RQ5在图像与SDF重建任务中,Spe在PSNR与视觉保真度方面与SIREN和傅里叶位置编码相比表现如何?
主要发现
- 在D-Faust数据集的Bimba形状上,Spe在Chamfer距离(1.18)和SDF MAE上均表现最佳,优于IGR(1.41)、SIREN(1.39)和FPE(1.44)。
- 在SDF回归任务中,Spe在Bimba上实现了最低的Chamfer距离(1.18),并在所有测试形状中持续位列前列。
- 在图像重建任务中,Spe在M=32个投影方向下,文本图像PSNR达到40.4,自然图像PSNR达到33.6,均优于SIREN(35.6和31.1)与FPE(33.7和30.8)。
- 视觉对比显示,Spe生成的图像更清晰,伪影更少,优于FPE(出现噪声图案)和SIREN(显得更模糊),且更贴近真实值。
- 多尺度训练方案实现了渐进式细化,提升了收敛性,并促进了SDF中精细几何细节的更好恢复。
- 消融实验表明,样条权重的可学习性显著增强了模型的建模能力,尤其在高频细节恢复方面优于固定编码。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。