[论文解读] Towards Robust Toxic Content Classification
本文提出了一种模型无关的方法,通过使用字符级扰动和非毒性干扰标记,在毒性内容分类器上生成逼真的对抗性攻击,某些情况下将检测召回率降低了50%以上。该研究引入了上下文去噪自编码器(CDAE)和对抗性训练以提升鲁棒性,结果表明将CDAE与BERT通过集成学习结合,可对两类攻击均提供最稳健的防御。
Toxic content detection aims to identify content that can offend or harm its recipients. Automated classifiers of toxic content need to be robust against adversaries who deliberately try to bypass filters. We propose a method of generating realistic model-agnostic attacks using a lexicon of toxic tokens, which attempts to mislead toxicity classifiers by diluting the toxicity signal either by obfuscating toxic tokens through character-level perturbations, or by injecting non-toxic distractor tokens. We show that these realistic attacks reduce the detection recall of state-of-the-art neural toxicity detectors, including those using ELMo and BERT, by more than 50% in some cases. We explore two approaches for defending against such attacks. First, we examine the effect of training on synthetically noised data. Second, we propose the Contextual Denoising Autoencoder (CDAE): a method for learning robust representations that uses character-level and contextual information to denoise perturbed tokens. We show that the two approaches are complementary, improving robustness to both character-level perturbations and distractors, recovering a considerable portion of the lost accuracy. Finally, we analyze the robustness characteristics of the most competitive methods and outline practical considerations for improving toxicity detectors.
研究动机与目标
- 调查最先进毒性内容分类器对逼真、模型无关的对抗性攻击(基于字符级扰动和干扰标记注入)的脆弱性。
- 开发能提升对字符级扰动和注入干扰标记鲁棒性的防御方法。
- 评估对抗性训练和一种新型上下文去噪自编码器(CDAE)在对抗攻击下恢复分类器性能的有效性。
- 比较不同模型(包括BERT和CDAE)在联合攻击类型下的鲁棒性特征。
- 为实际部署中构建更鲁棒的毒性检测系统提供实用指导。
提出的方法
- 利用大型背景语料库(Jigsaw 2019)和毒性标记词典,通过应用字符级扰动(例如将'u'替换为'*')或注入非毒性干扰标记来生成对抗性样本。
- 通过在训练数据中加入合成噪声样本进行对抗性训练,以提升对类似噪声模式的鲁棒性。
- 提出上下文去噪自编码器(CDAE),该模型利用字符级和上下文信息,在表征学习过程中重建和去噪被混淆的标记。
- 通过掩码标记重建方式,训练CDAE从扰动输入中预测原始标记,将字符级嵌入与基于Transformer的上下文编码相结合。
- 通过集成模型将CDAE与BERT结合,以利用其互补的鲁棒性:CDAE在字符级混淆方面表现优异,而BERT对干扰标记注入具有更强抵抗力。
- 在多个数据集(Jigsaw 2018、Jigsaw 2019、OffensEval 2019)上评估防御效果,使用F1和召回率等标准指标在对抗条件下的表现。
实验结果
研究问题
- RQ1最先进神经毒性检测器对使用字符级扰动和干扰标记注入的简单、模型无关对抗性攻击有多脆弱?
- RQ2在合成噪声数据上进行对抗性训练在不降低干净数据性能的前提下,能在多大程度上提升鲁棒性?
- RQ3上下文去噪自编码器(CDAE)能否学习到鲁棒表征,有效去除字符级混淆,同时保留上下文语义?
- RQ4不同模型(如BERT与CDAE)在面对不同攻击类型时,其鲁棒性特征有何差异?
- RQ5通过结合CDAE与BERT的互补优势,能否实现对多种攻击向量的更优鲁棒性?
主要发现
- 字符级扰动和干扰标记注入可使最先进毒性检测器(包括基于ELMo和BERT的模型)的召回率在某些情况下降低50%以上。
- 对抗性训练可提升对合成噪声的鲁棒性,但会导致在干净非对抗性数据上的性能出现可测量的下降。
- CDAE模型通过结合字符级信息和上下文信息进行去噪,显著提升了对字符级混淆的鲁棒性。
- 基于BERT的模型对干扰标记注入表现出更强的鲁棒性,而CDAE则对这类攻击较为脆弱。
- CDAE与BERT的集成模型通过结合其互补优势,实现了最高的整体鲁棒性,优于单一模型。
- 本研究表明,模型无关攻击极为有效,而鲁棒性防御必须同时考虑噪声类型和上下文语义。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。