Skip to main content
QUICK REVIEW

[论文解读] Chain Rules for Hessian and Higher Derivatives Made Easy by Tensor Calculus

Maciej Skórski|arXiv (Cornell University)|Nov 29, 2019
Tensor decomposition and applications参考文献 5被引用 4
一句话总结

本文提出了一种基于张量微积分的简化方法,用于在多元微积分中计算黑塞矩阵和高阶导数的链式法则,通过直观的指标配对和张量点积,避免了繁琐的矩阵代数。结果表明,通过将导数视为多维数组并应用无坐标张量运算,可以高效且紧凑地推导和计算复杂的高阶导数(尤其是重参数化下的黑塞矩阵),并通过使用 SymPy 的 Python 数值示例进行了验证。

ABSTRACT

Computing multivariate derivatives of matrix-like expressions in the compact, coordinate free fashion is very important for both theory and applied computations (e.g. optimization and machine learning). The critical components of such computations are \emph{chain and product rules} for derivatives. Although they are taught early in simple scenarios, practical applications involve high-dimensional arrays; in this context it is very hard to find easy accessible and compact explanation. This paper discusses how to relatively simply carry such derivations based on the (simplified as adapted in applied computer science) concept of tensors. Numerical examples in modern Python libraries are provided. This discussion simplifies and illustrates an earlier exposition by Manton (2012).

研究动机与目标

  • 为多元函数黑塞矩阵和高阶导数的链式法则提供一种清晰、紧凑且计算高效的推导方法。
  • 克服传统基于矩阵的方法在高维数组中因张量形状不兼容而失效的局限性。
  • 弥合多元微积分理论与机器学习和优化等应用领域实际实现之间的差距。
  • 提供一种统一且易于理解的框架,利用带有指标配对的张量点积,避免对元素级求导的依赖。
  • 通过使用现代 Python 库(如 SymPy)的数值示例验证该方法,突出由于导数约定差异导致的实现陷阱。

提出的方法

  • 本文将导数建模为多维数组(张量),其中函数的导数表示为对应于输入和输出指标的张量。
  • 引入带有显式指标配对的张量点积:将张量之间的匹配指标(例如雅可比矩阵的分量与目标函数的偏导数)通过求和进行收缩。
  • 通过在多个维度上灵活配对指标,将矩阵乘法推广到高阶张量,保持形状兼容性。
  • 利用混合偏导数的对称性(施瓦茨定理),简化张量收缩中的操作顺序。
  • 通过将乘积法则应用于一阶导数 $ D(f \bullet g) = Df(g) \cdot Dg $,再对其求导,推导出黑塞矩阵的链式法则:$ D^2(f \circ g) = (D^2f(g) \cdot Dg \cdot Dg) + (Df(g) \cdot D^2g) $。
  • 使用 SymPy 的 tensorcontraction 和 tensorproduct 函数进行数值验证,仔细处理导数维度顺序(例如,SymPy 中将导数维度置于首位,与标准约定不同)。

实验结果

研究问题

  • RQ1如何以紧凑、无坐标且计算高效的方式表达高维数组中黑塞矩阵和高阶导数的链式法则?
  • RQ2哪些张量运算能够在标准矩阵乘法因形状不匹配而失效时,实现正确且可扩展的二阶导数计算?
  • RQ3如何通过指标配对和张量收缩简化多元微积分中复杂导数表达式的推导?
  • RQ4在链式法则的数值实现中,不同导数约定(例如 SymPy 与标准约定)的实际影响是什么?
  • RQ5张量微积分能否为优化和机器学习中的传统基于矩阵的推导提供更直观且不易出错的替代方案?

主要发现

  • 复合函数 $ f(g(y)) $ 的黑塞矩阵可计算为 $ \mathbf{H}(f \circ g) = \mathbf{J}g^T \cdot \mathbf{H}f(g) \cdot \mathbf{J}g + \sum_{k=1}^{n} \frac{\partial f}{\partial y^k} \cdot \mathbf{H}g^k $,其中 $ \mathbf{J}g $ 为雅可比矩阵,$ \mathbf{H}g^k $ 为 $ g $ 的第 $ k $ 个分量的黑塞矩阵。
  • 张量点积的表述通过配对 $ g $ 的输出维度和 $ f $ 的输入维度的指标,正确处理了高阶导数,避免了形状不兼容问题。
  • 使用 SymPy 的数值评估验证了所推导链式法则的正确性,结果在给定重参数化下,罗森布罗克函数的黑塞矩阵为对角矩阵,其元素为 2 和 200。
  • 该方法通过张量收缩实现批量计算,避免了元素级求导,后者在高维问题中计算成本过高。
  • 本文指出,必须仔细考虑库特定的约定(例如,SymPy 将导数维度置于首位),以确保张量收缩的正确性。
  • 使用爱因斯坦求和记号和指标配对,为以紧凑且可解释的形式表达复杂导数规则提供了自然且可扩展的框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。