[论文解读] PROVEN: Certifying Robustness of Neural Networks with a Probabilistic Approach
PROVEN 引入了一种概率框架,用于在输入噪声具有已知分布的情况下认证神经网络的鲁棒性,将最坏情况下的鲁棒性验证扩展为统计保证。通过利用 CROWN 等方法提供的现有认证下界,其在 99.99% 置信度下实现了最高达 75% 的鲁棒性认证提升,显著优于最坏情况分析。
With deep neural networks providing state-of-the-art machine learning models for numerous machine learning tasks, quantifying the robustness of these models has become an important area of research. However, most of the research literature merely focuses on the extit{worst-case} setting where the input of the neural network is perturbed with noises that are constrained within an $\ell_p$ ball; and several algorithms have been proposed to compute certified lower bounds of minimum adversarial distortion based on such worst-case analysis. In this paper, we address these limitations and extend the approach to a extit{probabilistic} setting where the additive noises can follow a given distributional characterization. We propose a novel probabilistic framework PROVEN to PRObabilistically VErify Neural networks with statistical guarantees -- i.e., PROVEN certifies the probability that the classifier's top-1 prediction cannot be altered under any constrained $\ell_p$ norm perturbation to a given input. Importantly, we show that it is possible to derive closed-form probabilistic certificates based on current state-of-the-art neural network robustness verification frameworks. Hence, the probabilistic certificates provided by PROVEN come naturally and with almost no overhead when obtaining the worst-case certified lower bounds from existing methods such as Fast-Lin, CROWN and CNN-Cert. Experiments on small and large MNIST and CIFAR neural network models demonstrate our probabilistic approach can achieve up to around $75\%$ improvement in the robustness certification with at least a $99.99\%$ confidence compared with the worst-case robustness certificate delivered by CROWN.
研究动机与目标
- 为解决最坏情况鲁棒性认证在神经网络中的局限性,提出一种考虑已知输入噪声分布的概率框架。
- 提供模型预测在 ℓp 范数扰动范围内保持不变的概率的统计保证,而非仅依赖于最坏情况边界。
- 实现对具有 ReLU 等激活函数的全连接和卷积神经网络的实用且可扩展的鲁棒性认证。
- 证明可利用现有的验证框架(如 CROWN 和 Fast-Lin)以极低的计算开销,从最坏情况验证工具中复用认证下界,推导出概率性鲁棒性证书。
- 表明在具有结构化噪声的真实世界场景中,概率性鲁棒性证书相比最坏情况分析能提供显著更强的鲁棒性保证。
提出的方法
- PROVEN 将鲁棒性认证问题表述为计算在输入扰动下,真实类别与第二类最可能类别之间的边际保持为正的概率。
- 利用扰动的累积分布函数(CDF)计算边际超过阈值的概率,从而实现统计鲁棒性保证。
- 基于边际函数的线性边界,推导出闭式概率证书,利用最坏情况验证工具(如 CROWN)提供的现有认证下界。
- 应用中心极限定理和集中不等式,估计在噪声服从已知分布的假设下,模型在随机噪声下保持鲁棒的概率。
- 与最先进的验证工具(如 Fast-Lin、CROWN、CNN-Cert)无缝集成,复用其认证下界,以极低的额外计算开销计算概率性鲁棒性。
- 计算鲁棒性概率的理论上下界 γU 和 γL,以确保认证的统计有效性。
实验结果
研究问题
- RQ1当输入扰动服从已知概率分布时,我们能否提供神经网络鲁棒性的统计保证,而非假设最坏情况的对抗性扰动?
- RQ2从最坏情况分析转向概率性鲁棒性分析,能在多大程度上提升鲁棒性认证性能?
- RQ3能否利用最坏情况验证方法中已有的认证下界,以极低的计算开销高效推导出概率性鲁棒性证书?
- RQ4在具有不同架构和激活函数的真实世界模型(如 MNIST 和 CIFAR-10)中,概率性方法在多大程度上提升了鲁棒性认证?
- RQ5在不同神经网络配置和噪声分布下,概率性鲁棒性认证的置信水平和统计可靠性如何?
主要发现
- 在 MNIST 和 CIFAR-10 模型上评估时,PROVEN 在至少 99.99% 置信度下,相比 CROWN 等最坏情况方法,鲁棒性认证能力最高提升 75%。
- 对于具有 ReLU 激活函数的 MNIST 模型,PROVEN 将最坏情况下的平均认证鲁棒性半径从 0.0258 提升至 0.0373,平均提升 44.7%。
- 在具有 ReLU 激活函数的较大 CIFAR-10 模型上,PROVEN 将认证半径从 0.00222 提升至 0.00263,提升 18.06%,且具有高置信度和低方差。
- 随着蒙特卡洛采样数量的增加,概率性认证保持稳定并收敛,对于 MNIST ReLU 模型,标准差从 10 次采样时的 0.00165 降低至 100 次采样时的 0.00054。
- 该方法在不同激活函数(ReLU、tanh、arctan)和网络深度下均一致提升鲁棒性认证性能,展现出广泛的适用性。
- 概率性证书的推导几乎不增加额外计算成本,因其复用了 CROWN 和 Fast-Lin 等现有工具的认证下界。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。