[论文解读] Partition of unity networks: deep hp-approximation
该论文提出了统一划分网络(POUnets),一种深度学习架构,通过显式结合基于神经网络的统一划分与可学习的多项式基,实现高效、高阶的 $hp$-逼近。通过将空间划分与局部多项式逼近解耦,并采用两阶段最小二乘优化器,POUnets 在光滑函数上实现了 $hp$-收敛性,并在具有间断性的分段多项式问题上持续优于标准MLP,打破了维度灾难。
Approximation theorists have established best-in-class optimal approximation rates of deep neural networks by utilizing their ability to simultaneously emulate partitions of unity and monomials. Motivated by this, we propose partition of unity networks (POUnets) which incorporate these elements directly into the architecture. Classification architectures of the type used to learn probability measures are used to build a meshfree partition of space, while polynomial spaces with learnable coefficients are associated to each partition. The resulting hp-element-like approximation allows use of a fast least-squares optimizer, and the resulting architecture size need not scale exponentially with spatial dimension, breaking the curse of dimensionality. An abstract approximation result establishes desirable properties to guide network design. Numerical results for two choices of architecture demonstrate that POUnets yield hp-convergence for smooth functions and consistently outperform MLPs for piecewise polynomial functions with large numbers of discontinuities.
研究动机与目标
- 解决深度神经网络在高维函数逼近中理论逼近能力与实际优化失败之间的差距。
- 通过将类似 $hp$-有限元的结构直接嵌入神经网络架构,克服函数逼近中的维度灾难。
- 利用可微、无网格的统一划分与可学习多项式基,实现光滑及分段光滑函数的精确、可扩展逼近。
- 开发一种将划分学习与系数优化分离的训练策略,确保收敛性与稳定性。
- 证明POUnets可实现与有限元方法相当的指数收敛速率,同时避免网格生成。
提出的方法
- 该架构使用深度神经网络输出一个可微的统一划分 $\Phi = \{\phi_\alpha(\mathbf{x}; \bm{\xi})\}$,其中 $\phi_\alpha$ 为非负且和为一的函数,用于局部化逼近。
- 每个划分单元关联一个 $m$ 阶局部多项式基 $P_\beta(\mathbf{x})$,形成全局逼近函数 $y_{\text{POU}}(\mathbf{x}) = \sum_\alpha \phi_\alpha(\mathbf{x}; \bm{\xi}) \sum_\beta c_{\alpha,\beta} P_\beta(\mathbf{x})$。
- 采用两阶段优化策略:首先通过梯度下降训练划分网络,生成互不重叠、局部化的区域;其次通过全局最小二乘法求解系数 $c_{\alpha,\beta}$,以实现最优数据拟合。
- 该方法利用交替优化方案:通过梯度下降更新 $\bm{\xi}$,然后通过闭式解法求解 $\mathbf{c}$,确保每一步均达到全局最优。
- 该方法通过直接将 $hp$-类似结构嵌入网络,避免了维度的指数级增长,实现无网格、高阶逼近。
- 该方法应用于光滑与分段多项式函数的回归任务,划分网络采用ResNet架构,多项式基为标准形式。
实验结果
研究问题
- RQ1能否设计一种深度神经网络架构,实现高阶逼近与局部函数表示,且无需依赖人工调校的网格?
- RQ2能否通过将划分学习与系数拟合解耦的两阶段优化策略,实现在函数逼近中的指数收敛速率?
- RQ3能否通过将统一划分与多项式基直接嵌入网络架构,使性能优于标准MLP,尤其在具有间断性的问题上?
- RQ4该架构能否通过利用潜在的低维结构,在高维函数逼近中打破维度灾难?
- RQ5正则化与优化调度的选择如何影响最终划分的质量与逼近精度?
主要发现
- POUnets 在光滑函数上实现 $hp$-收敛性,表现出与网络规模和深度相关的指数收敛速率。
- 对于具有多个间断性的分段多项式函数,POUnets 在所有测试案例中均保持低于1%的逼近误差,持续优于标准MLP。
- 两阶段训练策略——先以强正则化预训练划分网络,再通过最小二乘法拟合系数——生成了互不重叠、局部化的划分,能自适应地捕捉函数特征。
- 在 $p=3$ 的分段二次波形案例中,经过第二阶段优化后,方法达到接近机器精度的准确度,表明其在捕捉复杂间断性方面具有高保真度。
- 正则化预训练阶段对构建清晰、无重叠的划分至关重要;若省略该阶段,收敛性不稳定或精度下降。
- 该架构的计算复杂度不随空间维度呈指数增长,表明其在高维回归任务中对维度灾难具有鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。