Skip to main content
QUICK REVIEW

[论文解读] Adaptive Adversarial Attack on Scene Text Recognition

Xiaoyong Yuan, Pan He|arXiv (Cornell University)|Jul 9, 2018
Adversarial Robustness in Machine Learning参考文献 34被引用 9
一句话总结

该论文提出Adaptive Attack,一种新颖的多任务学习方法,可自动学习对抗攻击中扰动最小化与误分类损失之间的最优权衡,从而消除手动超参数调优。该方法在场景文本识别任务中实现了超过99.9%的成功率,且攻击速度比最先进方法快3–6倍,使其成为首个适用于序列学习任务(如文本识别)的自适应攻击框架。

ABSTRACT

Recent studies have shown that state-of-the-art deep learning models are vulnerable to the inputs with small perturbations (adversarial examples). We observe two critical obstacles in adversarial examples: (i) Strong adversarial attacks (e.g., C&W attack) require manually tuning hyper-parameters and take a long time to construct an adversarial example, making it impractical to attack real-time systems; (ii) Most of the studies focus on non-sequential tasks, such as image classification, yet only a few consider sequential tasks. In this work, we speed up adversarial attacks, especially on sequential learning tasks. By leveraging the uncertainty of each task, we directly learn the adaptive multi-task weightings, without manually searching hyper-parameters. A unified architecture is developed and evaluated for both non-sequential tasks and sequential ones. To validate the effectiveness, we take the scene text recognition task as a case study. To our best knowledge, our proposed method is the first attempt to adversarial attack for scene text recognition. Adaptive Attack achieves over 99.9\% success rate with 3-6X speedup compared to state-of-the-art adversarial attacks.

研究动机与目标

  • 为解决现有对抗攻击方法因需大量手动超参数调优而效率低下,且难以满足实时系统需求的问题。
  • 将自适应多任务学习从非序列任务扩展至序列学习任务,特别是尚未在对抗攻击中充分探索的场景文本识别任务。
  • 开发一个统一的自动化框架,通过不确定性估计动态平衡扰动大小与误分类损失。
  • 评估自适应攻击在序列模型上的有效性,特别是基于CTC的序列转换模型。
  • 证明自适应权重学习可显著加速攻击生成过程,同时不牺牲攻击成功率或扰动质量。

提出的方法

  • 该方法将对抗攻击建模为多任务优化问题,联合最小化扰动幅度(ℓ₂距离)与目标误分类损失。
  • 采用贝叶斯深度学习中的不确定性加权方法,结合数据不确定性(aleatoric)与模型不确定性(epistemic),自动学习最优损失权重。
  • 通过建模CTC对齐过程,将方法扩展至序列任务,聚焦于目标位置附近(如插入、删除、替换点)的梯度更新。
  • Adaptive Attack 采用迭代优化与动态损失加权,损失权重在训练过程中基于不确定性估计进行更新,避免手动搜索。
  • 该框架使用共享架构,应用于非序列任务(如ImageNet)与序列任务(如SeqMNIST、场景文本识别)。
  • 扰动通过迭代方式生成,梯度聚焦于目标数字的边缘区域,同时监控CTC对齐以确保正确对齐至对抗目标。

实验结果

研究问题

  • RQ1基于不确定性的多任务学习能否有效应用于加速序列学习任务(如场景文本识别)的对抗攻击?
  • RQ2与固定或手动调优的权重相比,自适应损失加权在攻击成功率与扰动幅度方面表现如何?
  • RQ3所提方法能否在显著缩短时间的前提下实现高攻击成功率,相比C&W等迭代攻击方法?
  • RQ4不同的对抗操作(插入、替换、删除)如何影响攻击过程与CTC对齐动态?
  • RQ5该自适应框架在多样化的序列任务与数据集上是否保持鲁棒性?

主要发现

  • Adaptive Attack 在三个标准场景文本识别基准上实现了超过99.9%的攻击成功率,证明了其高效性。
  • 与最先进迭代攻击方法(如C&W)相比,该方法将攻击时间减少了3–6倍,显著提升了效率。
  • Adaptive Attack 在固定λ值基线方法与二分搜索调优方法中表现更优,收敛速度显著更快,同时保持相当或更优的扰动质量。
  • CTC对齐过程在100次迭代内迅速稳定,且保持一致,仅在目标操作点附近(如插入/删除的数字)发生微小变化。
  • 扰动初始阶段聚焦于目标位置附近的边缘区域,后期则被最小化为抽象的、人眼不可见的形式,但仍能欺骗模型。
  • 攻击过程表明,当对抗扰动与CTC注意力机制对齐时最为有效,且该方法在整个优化过程中成功维持了这种对齐。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。