Skip to main content
QUICK REVIEW

[论文解读] Noise-adding Methods of Saliency Map as Series of Higher Order Partial Derivative

Junghoon Seo, Jeongyeol Choe|arXiv (Cornell University)|Jun 8, 2018
Bayesian Modeling and Causal Inference参考文献 2被引用 15
一句话总结

本文通过多元泰勒展开和统计矩理论,对添加噪声的显著性方法 SmoothGrad 和 VarGrad 进行了严格的理论分析。研究发现,SmoothGrad 并未对得分函数的梯度进行平滑,而 VarGrad 与梯度无关,这挑战了以往的直观解释。该工作建立了高阶偏导数与模型可解释性之间的新联系。

ABSTRACT

SmoothGrad and VarGrad are techniques that enhance the empirical quality of standard saliency maps by adding noise to input. However, there were few works that provide a rigorous theoretical interpretation of those methods. We analytically formalize the result of these noise-adding methods. As a result, we observe two interesting results from the existing noise-adding methods. First, SmoothGrad does not make the gradient of the score function smooth. Second, VarGrad is independent of the gradient of the score function. We believe that our findings provide a clue to reveal the relationship between local explanation methods of deep neural networks and higher-order partial derivatives of the score function.

研究动机与目标

  • 为解决如 SmoothGrad 和 VarGrad 等添加噪声的显著性方法中存在的模糊性问题,尽管其在实证上表现强劲,但缺乏正式的理论解释。
  • 通过多元泰勒级数和统计矩展开,正式刻画 SmoothGrad 和 VarGrad 的数学行为。
  • 探究这些方法是否真正实现了梯度平滑,还是依赖于高阶导数信息。
  • 提出一个猜想,将得分函数的高阶偏导数与有意义的模型解释联系起来。

提出的方法

  • 作者应用多元泰勒定理,将得分函数在输入点附近展开,将显著性图的期望值和方差表示为高阶偏导数的级数形式。
  • 通过计算各向同性高斯噪声下梯度的期望和方差,推导出 SmoothGrad 和 VarGrad 的非随机解析近似。
  • 该推导使用多指标记号系统地处理高阶偏导数,并利用标准正态分布的矩性质。
  • 通过界定泰勒展开中的余项,量化近似误差,从而得到包含 $ D^\alpha S_c $ 和 $ \sigma^{2\alpha} $ 的显式表达式。
  • 利用标准正态变量乘积的矩恒等式,简化涉及 $ \mathbb{E}[Z^\alpha] $ 和 $ \mathrm{Var}(Z^\alpha) $ 的表达式。
  • 分析区分了多指标仅含偶数分量或混合奇偶分量的情况,导致最终近似形式不同。

实验结果

研究问题

  • RQ1SmoothGrad 是否如普遍假设的那样,有效平滑了得分函数的梯度?
  • RQ2VarGrad 是否真正依赖于得分函数的梯度,还是依赖于高阶导数项?
  • RQ3能否正式建立添加噪声方法的行为与得分函数高阶偏导数之间的联系?
  • RQ4在噪声条件下,期望显著性图与得分函数泰勒展开之间的精确数学关系是什么?
  • RQ5泰勒展开中的近似误差如何影响 SmoothGrad 和 VarGrad 的可靠性?

主要发现

  • SmoothGrad 并未对得分函数的梯度进行平滑;相反,它近似于高阶导数平方的加权和。
  • VarGrad 与一阶梯度无关,仅依赖于高阶偏导数,特别是偶数阶导数。
  • SmoothGrad 的解析形式主要由二阶及更高阶偶数阶导数主导,其系数包含 $ \sigma^{2\alpha} $ 和多项式系数。
  • 近似中的余项被界定为 $ O(\sigma^{l+1}) $,表明随着噪声方差减小,近似效果更好。
  • 该方法揭示,添加噪声方法的视觉质量源于其对高阶导数结构的敏感性,而非梯度平滑。
  • 研究结果挑战了当前普遍认为添加噪声方法通过减少梯度噪声来提升显著性的直觉,表明它们实际上强调了高阶特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。