Skip to main content
QUICK REVIEW

[论文解读] Reverse-Engineering Deep ReLU Networks

David Rolnick, Konrad P. Körding|arXiv (Cornell University)|Oct 2, 2019
Advanced Memory and Neural Computing参考文献 16被引用 15
一句话总结

本文展示了通过分析输入空间中线性区域之间的边界,可以对深度ReLU网络进行逆向工程。通过查询网络并识别ReLU单元在激活与非激活状态之间切换的位置,该方法能够恢复网络的架构、权重和偏置,直至同构为止,实现了全连接网络中第一层和第二层参数的高精度重建。

ABSTRACT

It has been widely assumed that a neural network cannot be recovered from its outputs, as the network depends on its parameters in a highly nonlinear way. Here, we prove that in fact it is often possible to identify the architecture, weights, and biases of an unknown deep ReLU network by observing only its output. Every ReLU network defines a piecewise linear function, where the boundaries between linear regions correspond to inputs for which some neuron in the network switches between inactive and active ReLU states. By dissecting the set of region boundaries into components associated with particular neurons, we show both theoretically and empirically that it is possible to recover the weights of neurons and their arrangement within the network, up to isomorphism.

研究动机与目标

  • 研究仅从深度ReLU网络的输出中是否可以恢复其架构、权重和偏置。
  • 开发一种基于查询的方法,通过分析线性区域之间的转换来识别ReLU网络的结构。
  • 证明即使在参数未知且网络不可公开访问的情况下,也能重建网络的内部组件。
  • 探讨该方法在深度学习安全和神经科学中的影响,特别是从功能输出中推断突触权重的可能性。

提出的方法

  • 该方法利用ReLU网络的分段线性特性,其中每个ReLU单元在状态从非激活切换到激活时,在输入空间中形成一个超平面边界。
  • 通过在这些边界附近发出有针对性的查询,该算法可识别每个ReLU边界的位置和方向,对应于神经元的权重和偏置。
  • 对于深层网络,该方法通过检测由级联ReLU转换形成的弯曲超平面之间的交点,来推断高层神经元的权重。
  • 该算法通过近似线性区域的排列并将其映射到单个神经元,实现网络重建,同时考虑同构性(如权重缩放和神经元排列)。
  • 该方法结合了几何探测与线性代数,从输出响应中估计每一层的权重矩阵和偏置向量。
  • 该方法对网络深度具有鲁棒性,适用于训练和未训练的网络,其性能在MNIST、记忆化任务和合成架构上进行了评估。

实验结果

研究问题

  • RQ1是否可以仅从查询输入的输出中恢复深度ReLU网络的权重和偏置?
  • RQ2在多大程度上可以仅从线性区域的排列中重建ReLU网络的内部架构?
  • RQ3该方法在不同网络深度和宽度下的表现如何,特别是在第二层及更高层?
  • RQ4网络恢复中的基本同构性是什么?如何在不损失功能的前提下处理这些同构性?
  • RQ5该方法能否在真实世界网络(如在MNIST上训练的网络)上以高精度应用?

主要发现

  • 该算法成功以高精度重建了2层、3层和4层全连接ReLU网络的第一层权重和偏置,平均对数归一化误差低于-5。
  • 在双隐层网络的第二层恢复中,该方法正确识别了大部分神经元,权重和偏置的对数归一化误差始终低于-4。
  • 恢复第一层所需的查询数量与神经元数量呈线性关系,表明查询复杂度高效。
  • 该方法对网络深度具有鲁棒性,适用于未训练和训练过的网络,包括在MNIST和记忆化任务上训练的网络。
  • 尽管存在不可避免的同构性(如权重缩放和神经元排列),该算法仍以极小误差恢复了真实参数的显著比例。
  • 该方法对输出噪声等防御措施无效,表明网络设计者可通过添加扰动来缓解逆向工程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。