Skip to main content
QUICK REVIEW

[论文解读] Adversarially trained neural representations may already be as robust as corresponding biological neural representations

Chong Guo, Michael J. Lee|arXiv (Cornell University)|Jun 19, 2022
Yersinia bacterium, plague, ectoparasites researchBiochemistry, Genetics and Molecular Biology被引用 19
一句话总结

本研究提出一种直接作用于灵长类 inferior temporal (IT) 大脑皮层神经活动的对抗性攻击方法,揭示灵长类生物神经表征对对抗性扰动的敏感性与最先进的鲁棒训练人工神经网络相当。关键发现是,IT 神经元对极小的 $l_2$-范数扰动(低至 $5$)极为敏感,挑战了长期以来认为生物视觉系统天然比人工系统更鲁棒的假设。

ABSTRACT

Visual systems of primates are the gold standard of robust perception. There is thus a general belief that mimicking the neural representations that underlie those systems will yield artificial visual systems that are adversarially robust. In this work, we develop a method for performing adversarial visual attacks directly on primate brain activity. We then leverage this method to demonstrate that the above-mentioned belief might not be well founded. Specifically, we report that the biological neurons that make up visual systems of primates exhibit susceptibility to adversarial perturbations that is comparable in magnitude to existing (robustly trained) artificial neural networks.

研究动机与目标

  • 检验灵长类视觉系统中高层级生物神经表征是否真的比人工神经网络更鲁棒于对抗性扰动。
  • 克服以往神经科学研究中依赖随机或粗粒度图像扰动的局限,开发一种针对神经记录的靶向性、迭代式攻击方法。
  • 在受控的 $l_2$-范数扰动预算下,直接比较单个 IT 神经元与鲁棒训练深度神经网络中单元的对抗性敏感性。
  • 探究灵长类视觉感知所表现出的鲁棒性是否源于群体水平的错误校正机制,而非单个神经元的抗扰能力。

提出的方法

  • 开发了一种专用于灵长类神经记录的迭代投影梯度下降(PGD)攻击方法,利用神经反应作为代理损失以优化对抗性扰动。
  • 采用两阶段 PGD 策略:首先在较大的 $l_2$-球体($2\epsilon$)内优化以提升探索能力,随后在 $\epsilon$ 内精细调整以实现精确扰动。
  • 采用模拟退火并配合重启机制,当无进展时将步长减少 10%,重复最多四次以逃离局部极小值。
  • 利用灵长类视觉处理的机制模型,生成能最大化单个 IT 神经元响应变化的图像扰动。
  • 在 $l_2$-范数约束下优化最坏情况扰动,确保对抗性敏感性被测量为神经元响应变化的下限。
  • 通过在 $\epsilon = 3$ 时比较 IT 神经元、标准 ResNet50 以及对抗性训练网络(AT-ResNet50、AT-WRN50-4)的对抗性敏感性来验证结果。

实验结果

研究问题

  • RQ1灵长类 IT 神经元是否对与深度学习鲁棒性研究中使用的规模相近的小 $l_2$-范数对抗性扰动敏感?
  • RQ2单个 IT 神经元的对抗性敏感性在数量上与最先进的鲁棒训练人工神经网络中单元的敏感性相比如何?
  • RQ3灵长类视觉感知的鲁棒性是源于单个神经元的抗扰能力,还是群体水平的错误校正机制?
  • RQ4在缺乏完整模型访问权限的情况下,能否有效将基于梯度的对抗性攻击应用于生物神经记录?
  • RQ5IT 神经元中的对抗性样本在图像空间中是否密集存在,使得任何图像都可被扰动以改变其类别选择性?

主要发现

  • 灵长类 IT 神经元对 $l_2$-范数扰动的敏感性可低至 $\epsilon = 2.5$,此类扰动对人类几乎完全不可察觉。
  • 在 $\epsilon = 3$ 时,IT 神经元的平均对抗性敏感性与对抗性训练的 DNN(AT-ResNet50、AT-WRN50-4)处于相近量级,挑战了生物系统在鲁棒性方面具有优越性的假设。
  • 对抗性扰动可完全改变单个 IT 神经元的类别选择性,表明其响应对微小、有针对性的像素变化高度敏感。
  • 本研究证明,对抗性样本在任一给定图像周围的图像空间中密集存在,表明视觉表征整体存在广泛脆弱性。
  • 鲁棒训练的人工神经网络在个体单元层面已达到或超过生物神经表征的对抗性鲁棒性水平。
  • 结果表明,灵长类视觉行为的鲁棒性可能并非源于单个神经元的抗扰能力,而是源于下游群体水平的解码或错误校正机制。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。