[论文解读] Verification of Recurrent Neural Networks Through Rule Extraction
本文提出一种基于从RNN中提取的确定性有限自动机(DFA)作为代理预言机的验证框架,用于检测序列数据中的对抗性扰动。该方法引入平均编辑距离作为度量标准以衡量扰动规模,并表明具有二次隐藏交互的二阶RNN在DFA提取方面最为稳定和准确,从而在Tomita语法上实现了有效的验证,其中仅有少数模型(如MI-RNN、二阶RNN)对对抗性样本保持鲁棒性。
The verification problem for neural networks is verifying whether a neural network will suffer from adversarial samples, or approximating the maximal allowed scale of adversarial perturbation that can be endured. While most prior work contributes to verifying feed-forward networks, little has been explored for verifying recurrent networks. This is due to the existence of a more rigorous constraint on the perturbation space for sequential data, and the lack of a proper metric for measuring the perturbation. In this work, we address these challenges by proposing a metric which measures the distance between strings, and use deterministic finite automata (DFA) to represent a rigorous oracle which examines if the generated adversarial samples violate certain constraints on a perturbation. More specifically, we empirically show that certain recurrent networks allow relatively stable DFA extraction. As such, DFAs extracted from these recurrent networks can serve as a surrogate oracle for when the ground truth DFA is unknown. We apply our verification mechanism to several widely used recurrent networks on a set of the Tomita grammars. The results demonstrate that only a few models remain robust against adversarial samples. In addition, we show that for grammars with different levels of complexity, there is also a difference in the difficulty of robust learning of these grammars.
研究动机与目标
- 为解决在序列数据应用中缺乏对循环神经网络(RNNs)的验证方法的问题,传统度量标准与预言机在此类场景下失效。
- 在真实DFA未知的情况下,开发一种严谨且自动化的RNN验证框架,利用提取的DFA作为代理预言机。
- 为基于字符串的序列数据中的对抗性扰动定义合适的距离度量标准,克服标准Lp范数的局限性。
- 通过所提出的框架在正则语法上,对多种RNN架构在对抗样本下的鲁棒性进行实证评估。
- 探究语法复杂度与RNN鲁棒学习难度之间的关系。
提出的方法
- 从训练好的RNN中提取确定性有限自动机(DFA),作为RNN决策逻辑的形式化、可解释的代理。
- 提出平均编辑距离作为新度量标准,用于衡量作用于正则语法生成字符串的对抗性扰动规模。
- 使用提取的DFA作为形式化预言机,验证扰动后的字符串是否仍属于原始语法的语言范围。
- 将验证问题形式化为约束优化任务,利用MILP或SMT求解器检查扰动下的鲁棒性。
- 将该框架应用于Tomita语法集——一组基准正则语言——以评估多种RNN架构在对抗性扰动下的鲁棒性。
- 对每种字符串长度执行30次试验,分别计算正样本和负样本的平均对抗鲁棒性得分(γ̄₊, γ̄₋)。
实验结果
研究问题
- RQ1从RNN中提取的DFA能否作为真实预言机的可靠代理,用于验证对抗鲁棒性?
- RQ2RNN架构的选择如何影响序列数据验证中DFA提取的稳定性和准确性?
- RQ3不同语法(按复杂度划分)在多大程度上影响RNN对对抗性扰动的鲁棒性?
- RQ4平均编辑距离能否有效衡量并约束基于字符串的数据中的对抗性扰动,同时保持语言有效性?
- RQ5哪些RNN架构在不遭受对抗攻击的前提下,能最好地泛化到长序列?
主要发现
- 具有二次或近似二次隐藏层交互的二阶RNN在所有Tomita语法中均持续产生最准确且最稳定的DFA提取结果。
- 仅二阶RNN与MI-RNN在所有测试语法中实现了完美的对抗鲁棒性(γ̄₊ = 1.00),未发现任何对抗样本。
- Elman-RNN在对抗准确性方面表现最差,尤其在语法3上,且随着字符串长度增加,性能显著下降,表明其对长序列的泛化能力差。
- 尽管语法7复杂度最低,却表现出对对抗样本的高度脆弱性,原因在于训练数据中存在类别不平衡,表明存在过拟合现象。
- 尽管语法3与语法4复杂度相似,语法4的鲁棒学习表现优于语法3,表明语法结构本身对鲁棒性的影响超越了复杂度本身。
- 平均编辑距离度量能有效捕捉扰动规模,并与鲁棒学习的难度相关联,从而实现RNN与语法之间的有意义比较。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。