[论文解读] FastWordBug: A Fast Method To Generate Adversarial Text Against NLP Applications
FastWordBug 是一种高效的黑盒对抗性攻击框架,通过利用词性(POS)标记权重来识别高影响力词汇,从而高效生成文本扰动以欺骗 NLP 模del。该方法在仅使用极少模型查询的情况下,将 Text-CNN 和 Word-LSTM 的模型准确率分别降低至 13.0% 和 21.0%,展现出极高的攻击效率和跨模型及云 API 的迁移能力。
In this paper, we present a novel algorithm, FastWordBug, to efficiently generate small text perturbations in a black-box setting that forces a sentiment analysis or text classification mode to make an incorrect prediction. By combining the part of speech attributes of words, we propose a scoring method that can quickly identify important words that affect text classification. We evaluate FastWordBug on three real-world text datasets and two state-of-the-art machine learning models under black-box setting. The results show that our method can significantly reduce the accuracy of the model, and at the same time, we can call the model as little as possible, with the highest attack efficiency. We also attack two popular real-world cloud services of NLP, and the results show that our method works as well.
研究动机与目标
- 开发一种快速、高效的黑盒对抗性攻击方法,用于 NLP 模型,以最小化模型查询次数。
- 量化词性(POS)标记与影响模型预测的词重要性之间的关系。
- 通过基于词性标记权重和置信度下降筛选高影响力词汇,提升攻击效率。
- 在真实世界数据集和商业 NLP 云服务上评估方法的有效性。
- 展示对抗性样本在不同模型和 API 之间的迁移能力。
提出的方法
- 该方法基于移除某个词时置信度下降的评分函数来评估词的重要性,定义为 $ C_{w_j} = \mathcal{F}_y(w) - \mathcal{F}_y(w \setminus w_j) $。
- 通过测量在数据集中,每种词性标记对应导致最大置信度下降的词的频率,计算词性标记权重。
- 从每类词性标记下高影响力词的频率中推导出经过 softmax 归一化的权重向量 $ W(t) $,以优先选择需修改的词汇。
- 攻击流程首先通过模型置信度评分识别重要句子,然后筛选出词性标记权重高于阈值的词汇。
- 通过将高影响力词汇替换为语义相似的同义词生成对抗性样本,从而在保持文本可用性的同时翻转预测结果。
- 该方法在黑盒威胁模型下运行,仅依赖模型查询输出(预测结果和置信度分数)。
实验结果
研究问题
- RQ1能否利用词性(POS)标记信息,高效识别出对文本对抗扰动最具影响力的词汇?
- RQ2如何通过减少模型查询次数,使 NLP 模型的对抗性攻击更加高效?
- RQ3FastWordBug 生成的对抗性样本在多大程度上能跨不同 NLP 模型和云 API 实现迁移?
- RQ4FastWordBug 在真实世界文本分类和情感分析任务中,降低模型准确率的效率如何?
- RQ5该方法能否在仅施加极少扰动的情况下,同时保持语义可用性并实现高攻击成功率?
主要发现
- FastWordBug 在 IMDB 情感分析数据集上,将 Text-CNN 和 Word-LSTM 的准确率分别从 87.0% 和 78.0% 降低至 13.0% 和 21.0%,且模型查询次数极少。
- 在 AG’s News 文本分类任务中,该方法将准确率降低至 36.0%(Text-CNN)和 31.5%(Word-LSTM),展现出强大的攻击效果。
- 该方法成功攻击了两个真实世界的云 NLP 服务——Aylien Sentiment 和 ParallelDots,将预测结果从负面翻转为正面,且置信度超过 50%。
- 对抗性样本表现出极强的迁移能力:在 Text-CNN 上生成的攻击,有 64.5% 成功迁移至 Word-LSTM;在 Word-LSTM 上生成的攻击,有 83.5% 成功迁移至 Text-CNN。
- 通过基于词性的过滤机制,FastWordBug 显著减少了所需的模型调用次数,实现了本研究中报告的最高攻击效率。
- 该方法保持了语义相似性,表现为对抗性样本与原始文本的差异极小,且可读性得以保留。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。