Skip to main content
QUICK REVIEW

[论文解读] Algorithmic Differentiation of Linear Algebra Functions with Application in Optimum Experimental Design (Extended Version)

Sebastian F. Walter, Lutz Lehmann|arXiv (Cornell University)|Jan 11, 2010
Control Systems and Identification参考文献 6被引用 3
一句话总结

本论文提出了一种新颖的算法微分(AD)算法,用于通过单变量泰勒多项式传播(UTPM)在前向和反向模式下计算矩形QR分解和对称特征值分解的高阶导数。该方法将线性代数函数视为基本运算,实现了接近机器精度的准确性,并在最优实验设计问题中实现了高效的梯度计算。

ABSTRACT

We derive algorithms for higher order derivative computation of the rectangular $QR$ and eigenvalue decomposition of symmetric matrices with distinct eigenvalues in the forward and reverse mode of algorithmic differentiation (AD) using univariate Taylor propagation of matrices (UTPM). Linear algebra functions are regarded as elementary functions and not as algorithms. The presented algorithms are implemented in the BSD licensed AD tool exttt{ALGOPY}. Numerical tests show that the UTPM algorithms derived in this paper produce results close to machine precision accuracy. The theory developed in this paper is applied to compute the gradient of an objective function motivated from optimum experimental design: $ abla_x Φ(C(J(F(x,y))))$, where $Φ= \{λ_1 : λ_1 C\}$, $C = (J^T J)^{-1}$, $J = \frac{\dd F}{\dd y}$ and $F = F(x,y)$.

研究动机与目标

  • 开发针对QR和特征值分解等关键线性代数函数的高效、高精度算法微分方法。
  • 在AD中将线性代数例程视为基本函数,避免对其内部算法进行微分。
  • 在涉及矩阵函数的最优实验设计问题中实现准确的梯度计算。
  • 在开源ALGOPY AD工具中实现并基准测试所推导的算法。
  • 展示基于UTPM的AD相较于传统AD对线性代数例程微分在性能和内存效率方面的优越性。

提出的方法

  • 使用单变量泰勒多项式传播(UTPM)将矩阵值函数表示为关于辅助变量t的多项式展开。
  • 推导了具有互异特征值的矩形QR分解和对称特征值分解的前向与反向模式AD算法。
  • 通过提升函数表示法应用反向传播和前向传播操作,实现通过矩阵分解传播导数信息。
  • 将矩阵分解视为原子操作,避免对其中迭代算法的微分。
  • 在ALGOPY中实现算法,ALGOPY是一款BSD许可的AD工具,采用具有双重链接节点的计算图,而非顺序记录带。
  • 利用矩阵泰勒展开高效计算高阶导数,降低内存使用并提升性能。

实验结果

研究问题

  • RQ1如何通过算法微分高效计算矩形QR分解的高阶导数?
  • RQ2在反向模式AD中,具有互异特征值的对称特征值分解的伴随(反向传播)结构是什么?
  • RQ3基于UTPM的AD与对底层线性代数算法进行微分相比,在精度和性能方面有何差异?
  • RQ4在AD中将线性代数函数视为基本运算,是否能在科学计算应用中实现更好的数值稳定性和效率?
  • RQ5基于UTPM的AD对最优实验设计问题中梯度计算的实际影响是什么?

主要发现

  • 基于UTPM的AD算法实现了接近机器精度的数值精度,与符号导数相比,相对误差约为4.4×10⁻¹⁵。
  • 前向传播运行时间比(UTPM AD与正常函数计算之比)在QR分解中约为11.79,在特征值分解中约为11.88,表明存在适度的开销。
  • ALGOPY中的UTPM实现优于通过PYADOLC实现的UTPS微分,尤其在处理大矩阵时,得益于更优的内存访问和计算结构。
  • 该方法通过避免存储中间值并利用解析导数公式,将反向模式AD的内存需求降低至O(D)。
  • 该方法可实现对最优实验设计中目标函数Φ = (JᵀJ)⁻¹的最大特征值的稳定且准确的梯度计算。
  • ALGOPY中的实现已公开发布于GitHub,可作为经过验证的、可移植AD算法的测试平台。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。