[论文解读] Random Weight Factorization Improves the Training of Continuous Neural Representations
本文提出随机权重分解——一种针对基于坐标的MLP中线性层的简单重参数化方法,通过为每个神经元实现自适应学习率,提升训练效率。通过将权重分解为随机初始化的缩放因子与方向向量,该方法重塑了损失曲面,减轻了谱偏差,并在计算机视觉、图形学和科学计算等多样化任务中加速了收敛。
Continuous neural representations have recently emerged as a powerful and flexible alternative to classical discretized representations of signals. However, training them to capture fine details in multi-scale signals is difficult and computationally expensive. Here we propose random weight factorization as a simple drop-in replacement for parameterizing and initializing conventional linear layers in coordinate-based multi-layer perceptrons (MLPs) that significantly accelerates and improves their training. We show how this factorization alters the underlying loss landscape and effectively enables each neuron in the network to learn using its own self-adaptive learning rate. This not only helps with mitigating spectral bias, but also allows networks to quickly recover from poor initializations and reach better local minima. We demonstrate how random weight factorization can be leveraged to improve the training of neural representations on a variety of tasks, including image regression, shape representation, computed tomography, inverse rendering, solving partial differential equations, and learning operators between function spaces.
研究动机与目标
- 解决多尺度信号连续神经表征训练中的挑战,此类信号常因收敛缓慢且难以捕捉高频细节而受限。
- 克服基于坐标的MLP中的谱偏差问题,即网络优先学习低频分量而忽略精细细节。
- 在无需任务特定超参数调优或先验信号知识的前提下,提升训练稳定性和泛化能力。
- 开发一种即插即用的方法,通过极少的架构修改显著提升标准MLP的性能并实现一致的性能增益。
提出的方法
- 提出随机权重分解:将每个神经元的权重向量分解为 $\bm{w}^{(k,l)} = s^{(k,l)} \cdot \bm{v}^{(k,l)}$,其中 $s^{(k,l)}$ 为可学习的缩放因子,$\bm{v}^{(k,l)}$ 为一次性随机初始化的方向向量。
- 利用该分解对MLP中的标准线性层进行重参数化,将 $\bm{W}^{(l)}$ 替换为 $\mathrm{diag}(\bm{s}^{(l)}) \cdot \bm{V}^{(l)}$。
- 通过梯度下降联合训练缩放因子 $s^{(k,l)}$ 和方向向量 $\bm{v}^{(k,l)}$,使每个神经元能够自适应调整其学习率。
- 证明该分解可改变损失曲面的几何结构,缩短参数配置之间的距离,从而加速逃离不良局部极小值。
- 作为即插即用模块应用于多种架构,包括标准MLP、SIREN以及用于算子学习的改进DeepONets。
- 通过结合傅里叶特征映射与残差损失最小化,将该方法集成至物理信息神经网络(PINNs)和DeepONets中。
实验结果
研究问题
- RQ1随机权重分解如何影响连续神经表征中损失曲面的几何结构?
- RQ2在不同类型的信号中,随机权重分解在多大程度上能缓解基于坐标的MLP中的谱偏差?
- RQ3随机权重分解是否能提升涉及高频信号的任务(如PDE求解与逆向渲染)中的训练收敛性与泛化能力?
- RQ4该方法在图像回归、形状表征与算子学习等多样化领域中,无需任务特定调优时表现如何?
- RQ5由分解诱导的自适应学习率是否能加快从不良权重初始化中的恢复速度?
主要发现
- 随机权重分解在所有评估任务中显著缩短了训练时间并加快了收敛速度,包括图像回归、形状表征与PDE求解。
- 该方法使MLP能更有效地学习高频分量,减少谱偏差,并在精细细节的重建精度上表现更优。
- 在Burgers' PDE任务中,采用随机权重分解的物理信息DeepONet相比标准基线与SIREN基线,测试误差更低,且在未见初始条件下的泛化能力更优。
- 在逆向渲染与计算机断层扫描任务中,该方法在所有信号类型上均持续优于标准MLP与SIREN网络,展现出强鲁棒性。
- 在随机权重分解下,损失曲面变得更平坦且连通性更强,从而加速逃离不良局部极小值并获得更优的最终解。
- 该方法无需额外超参数调优,且在包括复杂多尺度信号在内的多种架构与数据集上均表现出一致的性能提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。