[论文解读] On Robust Prefix-Tuning for Text Classification
本文提出了一种鲁棒的前缀调优框架,可在不修改预训练模型参数的情况下提升文本分类任务中的对抗鲁棒性。通过在推理过程中使用正确分类的训练数据的逐层激活作为参考,对每批输入动态调优一个批次特定的前缀,该方法在保持干净输入高准确率的同时,显著增强了对多样化文本攻击的鲁棒性,且保留了前缀调优的模块化与高效性。
Recently, prefix-tuning has gained increasing attention as a parameter-efficient finetuning method for large-scale pretrained language models. The method keeps the pretrained models fixed and only updates the prefix token parameters for each downstream task. Despite being lightweight and modular, prefix-tuning still lacks robustness to textual adversarial attacks. However, most currently developed defense techniques necessitate auxiliary model update and storage, which inevitably hamper the modularity and low storage of prefix-tuning. In this work, we propose a robust prefix-tuning framework that preserves the efficiency and modularity of prefix-tuning. The core idea of our framework is leveraging the layerwise activations of the language model by correctly-classified training data as the standard for additional prefix finetuning. During the test phase, an extra batch-level prefix is tuned for each batch and added to the original prefix for robustness enhancement. Extensive experiments on three text classification benchmarks show that our framework substantially improves robustness over several strong baselines against five textual attacks of different types while maintaining comparable accuracy on clean texts. We also interpret our robust prefix-tuning framework from the optimal control perspective and pose several directions for future research.
研究动机与目标
- 解决前缀调优在面对文本对抗攻击时缺乏鲁棒性的问题,同时保持其参数效率与模块化特性。
- 开发一种无需辅助模型更新或存储的防御机制,以维持前缀调优的轻量化特性。
- 从最优控制的角度,将鲁棒前缀调优形式化为闭环控制问题。
- 通过基于激活的监督,在推理过程中实现动态的、批次级别的前缀调优,以增强鲁棒性。
- 在显著提升多种对抗攻击类型下的鲁棒性的同时,保持对干净输入的高性能表现。
提出的方法
- 该框架使用正确分类的训练样本的逐层激活作为模型‘正确’行为的参考,并将其投影到低维的规范流形上。
- 在推理过程中,为每个输入批次动态调优一个额外的批次级前缀,以使模型的激活与正确预测的规范流形对齐。
- 优化过程通过最小化模型的逐层激活与规范流形之间的距离来实现,同时将原始前缀作为固定基底。
- 该方法利用连续时间法的逐次逼近法(MSA)求解优化问题,其等价于反向传播。
- 该框架被形式化为一个闭环控制系统,其中动态前缀作为控制输入,引导模型在扰动下仍能做出正确预测。
- 该方法保留了原始前缀调优的设置,仅在推理阶段引入一种轻量级的、每批次的调优机制。
实验结果
研究问题
- RQ1我们能否在不修改预训练模型参数的前提下,提升前缀调优对文本对抗攻击的鲁棒性?
- RQ2我们能否在增强鲁棒性的同时,保持前缀调优的模块化与低存储特性?
- RQ3如何利用干净数据的激活模式,在推理过程中定义并强制实现‘正确’的模型行为?
- RQ4我们能否将鲁棒前缀调优形式化为闭环控制问题,以提升在对抗输入下的泛化能力?
- RQ5所提出的方法是否能在多种攻击类型下实现显著的鲁棒性提升,同时保持干净数据上的准确率?
主要发现
- 所提框架在三个文本分类基准数据集上,对五类不同的文本对抗攻击,均显著优于强基线模型,展现出显著的鲁棒性提升。
- 该方法在干净测试集上保持了相近的准确率,表明鲁棒性提升并未以牺牲干净数据上的性能为代价。
- 该框架通过将批次级激活与来自正确分类训练样本的规范流形对齐,有效减少了对抗扰动下的预测错误。
- 理论分析表明,鲁棒前缀调优过程等价于闭环控制,为其实现鲁棒性的机制提供了原则性解释。
- 该方法计算效率高,无需额外模型存储或参数更新,完整保留了前缀调优的模块化特性。
- 该框架对通用对抗触发器(UAT)及其他针对提示学习模型的攻击类型均表现出有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。