[论文解读] Generating Adversarial Examples in Chinese Texts Using Sentence-Pieces
本文提出了一种基于句子片段分词和预训练掩码语言模型作为替换生成器的中文文本分片级对抗样本生成方法。通过在子词级别生成自然流畅的对抗样本,该方法在保持语义和流畅性的同时实现了较高的攻击成功率,其生成质量与人工评估结果均优于字符级和词级方法。
Adversarial attacks in texts are mostly substitution-based methods that replace words or characters in the original texts to achieve success attacks. Recent methods use pre-trained language models as the substitutes generator. While in Chinese, such methods are not applicable since words in Chinese require segmentations first. In this paper, we propose a pre-train language model as the substitutes generator using sentence-pieces to craft adversarial examples in Chinese. The substitutions in the generated adversarial examples are not characters or words but extit{'pieces'}, which are more natural to Chinese readers. Experiments results show that the generated adversarial samples can mislead strong target models and remain fluent and semantically preserved.
研究动机与目标
- 为解决中文文本中因词边界模糊,导致字符级替换常破坏流畅性的问题。
- 通过引入子词级别(分片级别)的替换策略,克服现有中文NLP中词级或字符级替换方法的局限性。
- 利用句子片段分词训练一个预训练掩码语言模型,以生成语义一致且流畅的对抗样本。
- 评估分片级对抗样本在攻击强健的BERT-based模型时的有效性,同时保持语义完整性和人工可读性。
提出的方法
- 使用句子片段分词在大规模中文文本上训练掩码语言模型,构建捕捉子词单元的分片级词汇表。
- 将预训练模型作为替换生成器,在分片级别而非字符或词级别生成候选替换。
- 通过替换输入文本中的特定分片来构造对抗样本,以误导目标模型,同时保持流畅性和语义一致性。
- 采用黑盒攻击设置,目标模型的架构未知,仅使用其预测得分来引导攻击过程。
- 在攻击过程中,利用预训练嵌入的余弦相似度筛选高质量候选替换。
- 开展人工评估以衡量流畅性和标签保留程度,确保对抗样本保持自然且语义一致。
实验结果
研究问题
- RQ1通过句子片段分词生成的分片级替换,是否能在中文文本中生成比字符级或词级方法更流畅且语义保留更好的对抗样本?
- RQ2在句子片段分词表示上预训练的掩码语言模型,在生成中文文本分类模型的高质量对抗替换方面效果如何?
- RQ3候选替换列表大小与生成对抗样本的质量(流畅性、语义保留)之间存在何种权衡?
- RQ4分片级对抗样本在多样化的中文NLP任务上,对强健的微调BERT模型的攻击成功率如何?
主要发现
- 所提出的分片级对抗攻击在IflyTek上达到11.0%的攻击成功率,在Weibo上达到35.0%,在Sogou上达到18.5%,在Law34上达到12.0%,在流畅性和语义质量方面优于字符级和词级基线方法。
- 人工评估者在IflyTek上正确识别了94%的对抗样本标签,在Weibo上为90%,在Sogou上为93%,在Law34上为97%,表明标签保留能力极强。
- 生成的对抗样本平均流畅度评分为:IflyTek为4.5,Weibo为4.2,Sogou为4.2,Law34为4.8,显著高于字符级方法。
- 尽管攻击成功率略低,分片级方法在流畅性和语义保留方面优于字符级和词级基线,表明其生成的对抗样本质量更高。
- 权衡曲线显示,增加候选列表大小可提升攻击成功率,但分片级方法在中等大小列表下仍能保持高流畅性和语义质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。