Skip to main content
QUICK REVIEW

[论文解读] Backpropagation generalized for output derivatives

Vsevolod I. Avrutskiy|arXiv (Cornell University)|Dec 12, 2017
Neural Networks and Applications参考文献 16被引用 6
一句话总结

该论文将反向传播算法推广至使用网络输出对输入的导数来训练前馈神经网络,从而实现微分算子的精确计算。该方法支持多维输入的任意阶导数,利用矩阵-向量运算实现高效并行化,并可在无需数值近似的情况下求解偏微分方程(PDE),为有限差分法提供了一种新颖且精确的替代方案。

ABSTRACT

Backpropagation algorithm is the cornerstone for neural network analysis. Paper extends it for training any derivatives of neural network's output with respect to its input. By the dint of it feedforward networks can be used to solve or verify solutions of partial or simple, linear or nonlinear differential equations. This method vastly differs from traditional ones like finite differences on a mesh. It contains no approximations, but rather an exact form of differential operators. Algorithm is built to train a feed forward network with any number of hidden layers and any kind of sufficiently smooth activation functions. It's presented in a form of matrix-vector products so highly parallel implementation is readily possible. First part derives the method for 2D case with first and second order derivatives, second part extends it to N-dimensional case with any derivatives. All necessary expressions for using this method to solve most applied PDE can be found in Appendix D.

研究动机与目标

  • 将反向传播从权重梯度扩展至包括网络输出对输入的导数,从而实现对导数的训练。
  • 提供一种通用方法,通过精确微分算子训练前馈网络以求解偏微分方程(PDE)。
  • 支持任意阶导数(一阶、二阶等)和多维输入(二维、N维),并兼容任意光滑激活函数。
  • 通过矩阵-向量公式实现高性能、可并行化的实现,以支持可扩展训练。
  • 为经典数值方法(如有限差分法)提供非近似替代方案,避免数值黏性与基于网格的离散化问题。

提出的方法

  • 利用链式法则和递归矩阵-向量乘积,推导隐藏层中一阶与二阶导数的前向传播。
  • 引入广义微分算子 $\mathbb{D}^S$,通过Faà di Bruno公式计算激活函数的高阶导数。
  • 通过涉及 $W_{(n)(n-1)}^{\theta\kappa}\sigma'(z_{n-1}^\kappa)$ 的雅可比类似项,将导数传播表示为矩阵-向量运算。
  • 应用Faà di Bruno的组合公式,将高阶导数分解为导数指标划分的求和。
  • 通过在输出导数上应用链式法则,推导权重与偏置梯度表达式,从而可与标准优化方法(如RProp或梯度下降)结合使用。
  • 通过推广导数索引与算子结构,将该框架从二维扩展至N维输入。

实验结果

研究问题

  • RQ1反向传播能否被推广,使神经网络不仅能基于输出值,还能基于其对输入的导数进行训练?
  • RQ2该广义方法能否在无需数值近似的情况下精确计算微分算子,避免数值黏性等问题?
  • RQ3能否基于标准前馈网络,推导出适用于多维输入空间中任意阶导数的统一、可扩展算法?
  • RQ4如何利用矩阵-向量运算实现导数训练的高效、可并行化实现?
  • RQ5该方法能否通过训练网络使其满足微分方程与边界条件,从而用于求解PDE?

主要发现

  • 广义反向传播算法可精确计算神经网络输出对输入的任意阶导数,避免了数值近似。
  • 该方法支持任意数量的隐藏层和任意足够光滑的激活函数,确保了广泛适用性。
  • 导数传播通过矩阵-向量乘积实现,可在现代硬件上实现高效、高度并行化的训练。
  • 该框架在附录D中提供了所有必要导数的显式表达式,涵盖二维与N维情况下的所有标准PDE算子。
  • 该方法可通过直接训练网络使其满足微分方程,提供一种无网格的有限差分法替代方案。
  • 该方法可用于通过训练网络来校正残差误差,从而提升现有数值解的精度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。