Skip to main content
QUICK REVIEW

[论文解读] Towards Evaluating the Robustness of Chinese BERT Classifiers

Boxin Wang, Boyuan Pan|arXiv (Cornell University)|Apr 7, 2020
Adversarial Robustness in Machine Learning参考文献 20被引用 8
一句话总结

本文提出 AdvChar,一种针对中文 BERT 分类器的新型字符级对抗攻击方法,通过在嵌入空间中生成最小扰动来替换关键字符。该攻击平均仅需不到两个字符的更改,便将分类准确率从 91.8% 降低至 0%,而人类表现基本不受影响,揭示了中文 BERT 模型存在严重的鲁棒性问题。

ABSTRACT

Recent advances in large-scale language representation models such as BERT have improved the state-of-the-art performances in many NLP tasks. Meanwhile, character-level Chinese NLP models, including BERT for Chinese, have also demonstrated that they can outperform the existing models. In this paper, we show that, however, such BERT-based models are vulnerable under character-level adversarial attacks. We propose a novel Chinese char-level attack method against BERT-based classifiers. Essentially, we generate "small" perturbation on the character level in the embedding space and guide the character substitution procedure. Extensive experiments show that the classification accuracy on a Chinese news dataset drops from 91.8% to 0% by manipulating less than 2 characters on average based on the proposed attack. Human evaluations also confirm that our generated Chinese adversarial examples barely affect human performance on these NLP tasks.

研究动机与目标

  • 研究中文 BERT 基分类器在对抗攻击下的鲁棒性,因现有研究主要聚焦于英文模型。
  • 解决在离散、高词汇量的中文文本领域中生成高效、可扩展对抗样本的挑战。
  • 评估在白盒设置下生成的对抗样本能否迁移至黑盒模型,以模拟真实世界攻击场景。
  • 通过人工评估验证生成的对抗样本的自然性与人类不可察觉性。

提出的方法

  • AdvChar 在嵌入空间中执行基于梯度的字符替换,以最小化扰动幅度并最大化攻击成功率。
  • 该方法使用离散字符替换过程的可微松弛,实现通过嵌入层的反向传播。
  • 采用带有超参数 c 和 κ 的约束优化框架,以控制攻击成功率与扰动大小之间的权衡。
  • 攻击在目标攻击与非目标攻击两种设置下应用,生成的对抗样本利用了 BERT 注意力机制中的统计线索。
  • 通过使用白盒生成的对抗样本攻击无参数访问的黑盒 BERT 模型,评估其迁移能力。
  • 人工评估涉及母语者对干净数据集与对抗数据集中的句子进行标注,以评估感知相似性。

实验结果

研究问题

  • RQ1字符级对抗攻击能否在最小扰动下有效降低中文 BERT 分类器的性能?
  • RQ2所提出的 AdvChar 方法在中文语言中实现高攻击成功率的同时,能否保持低扰动水平?
  • RQ3在白盒设置下生成的对抗样本在多大程度上可迁移至黑盒 BERT 模型?
  • RQ4与干净输入相比,人类标注者如何感知生成的对抗样本在语义与句法完整性方面的表现?

主要发现

  • 非目标攻击在 THUCTC 和 WeChat 数据集上均达到 100% 成功率,平均仅需不到两个字符更改,便将 BERT 准确率从 91.8% 降至 0%。
  • 目标攻击在 THUCTC 数据集上达到 95% 成功率,在 WeChat 数据集上达到 100% 成功率,表明其在将输入错误分类至特定错误标签方面具有高精度。
  • 迁移性实验表明,白盒生成的对抗样本使黑盒 BERT 在 WeChat 数据集上的准确率从 88.2% 降至 14.3%。
  • 人工评估显示,对抗样本上的性能仅下降 4%(从 84% 降至 80%),表明攻击对母语者而言几乎不可察觉。
  • 案例研究显示,BERT 模型依赖特定字符(如“Yu”代表娱乐,“Qi”代表金融产品)作为统计线索,使其容易受到有针对性的替换攻击。
  • 提高超参数 c 和 κ 可提升攻击成功率,但需要更多字符扰动,证实了有效性与隐蔽性之间的权衡。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。