[论文解读] Metamorphic Relation Based Adversarial Attacks on Differentiable Neural Computer
本文提出基于可变关系的对抗性攻击方法,用于评估可微神经计算机(DNCs)在自然语言问答任务中的鲁棒性。通过采用自动策略(如Pick-n-Plug和Pick-Permute-Plug)生成语法正确但语义改变的输入,该方法干扰DNC的内存操作(尤其是读取、写入和擦除功能),导致性能显著下降,尽管基线准确率接近完美。
Deep neural networks (DNN), while becoming the driving force of many novel technology and achieving tremendous success in many cutting-edge applications, are still vulnerable to adversarial attacks. Differentiable neural computer (DNC) is a novel computing machine with DNN as its central controller operating on an external memory module for data processing. The unique architecture of DNC contributes to its state-of-the-art performance in tasks which requires the ability to represent variables and data structure as well as to store data over long timescales. However, there still lacks a comprehensive study on how adversarial examples affect DNC in terms of robustness. In this paper, we propose metamorphic relation based adversarial techniques for a range of tasks described in the natural processing language domain. We show that the near-perfect performance of the DNC in bAbI logical question answering tasks can be degraded by adversarially injected sentences. We further perform in-depth study on the role of DNC's memory size in its robustness and analyze the potential reason causing why DNC fails. Our study demonstrates the current challenges and potential opportunities towards constructing more robust DNCs.
研究动机与目标
- 研究可微神经计算机(DNCs)在自然语言处理任务中对对抗性攻击的鲁棒性。
- 解决由于文本输入具有离散性和不可微性而难以在自然语言处理中生成对抗性样本的挑战。
- 评估DNC内存大小对其在对抗性攻击下鲁棒性的影响。
- 分析对抗性输入如何通过控制器控制信号(读取、写入、擦除功能)干扰DNC控制器的行为。
提出的方法
- 提出一种基于可变关系的框架,用于生成在自然语言处理任务中保持语法正确性和语义一致性的对抗性样本。
- 引入两种自动化、可扩展的攻击策略:Pick-n-Plug和Pick-Permute-Plug,将对抗性句子注入训练或测试序列中。
- 使用余弦相似度和KL散度比较干净输入与对抗性输入之间的控制信号(键、向量、门值)。
- 分析控制器在三个输入段(故事、对抗性句子、问题)中的行为,以定位对抗性影响。
- 采用bAbI任务#19作为基准,评估攻击成功率和性能下降情况。
- 使用KL散度比较门值分布(自由、分配、写入、擦除),以检测对抗性输入下显著的偏差。
实验结果
研究问题
- RQ1基于可变关系的对抗性攻击是否能有效降低DNC在自然语言问答任务中的性能?
- RQ2对抗性句子的注入如何通过控制器控制信号影响DNC的内存操作(读取、写入、擦除)?
- RQ3增加DNC的内存大小是否能显著提升其对这类对抗性攻击的鲁棒性?
- RQ4输入位置、内容类型和长度在决定对抗性攻击对DNC攻击成功率中的作用是什么?
主要发现
- 所提出的对抗性攻击在bAbI任务#19上成功降低了DNC的性能,尽管输入语法正确,但近似完美的准确率显著下降。
- KL散度分析显示,在成功攻击下,对抗性段落中的门值(尤其是分配门和写入门)表现出显著更高的发散性,相较于干净输入或失败攻击。
- DNC控制器键与向量之间的余弦相似度在对抗性段落中明显下降(例如,UAA与SAA之间写入门键的余弦相似度为0.8593),表明控制信号受到显著干扰。
- 门值中最大的KL散度出现在对抗性段落的分配门和写入门中,表明这些操作是攻击的主要目标。
- 增大内存大小仅带来有限的鲁棒性提升,表明内存容量本身无法有效缓解此类攻击的脆弱性。
- 控制信号分析表明,对抗性攻击干扰了DNC的读取、写入和擦除功能,其中最显著的影响体现在控制器的门值和注意力机制上。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。