Skip to main content
QUICK REVIEW

[論文レビュー] Adaptive Adversarial Attack on Scene Text Recognition

Xiaoyong Yuan, Pan He|arXiv (Cornell University)|Jul 9, 2018
Adversarial Robustness in Machine Learning参考文献 34被引用数 9
ひとこと要約

本稿では、摂動最小化と誤分類損失の間の最適なトレードオフ重みを自動で学習する、Adaptive Attackと呼ばれる新しいマルチタスク学習アプローチを提案する。これにより、手動でのハイパーパrameterチューニングが不要となり、シーンテキスト認識タスクにおいて99.9%を超える成功率を達成し、最先端の手法と比較して3–6倍高速な攻撃速度を実現した。これは、テキスト認識のような順序付き学習タスクにおける最初の適応的攻撃フレームワークである。

ABSTRACT

Recent studies have shown that state-of-the-art deep learning models are vulnerable to the inputs with small perturbations (adversarial examples). We observe two critical obstacles in adversarial examples: (i) Strong adversarial attacks (e.g., C&W attack) require manually tuning hyper-parameters and take a long time to construct an adversarial example, making it impractical to attack real-time systems; (ii) Most of the studies focus on non-sequential tasks, such as image classification, yet only a few consider sequential tasks. In this work, we speed up adversarial attacks, especially on sequential learning tasks. By leveraging the uncertainty of each task, we directly learn the adaptive multi-task weightings, without manually searching hyper-parameters. A unified architecture is developed and evaluated for both non-sequential tasks and sequential ones. To validate the effectiveness, we take the scene text recognition task as a case study. To our best knowledge, our proposed method is the first attempt to adversarial attack for scene text recognition. Adaptive Attack achieves over 99.9\% success rate with 3-6X speedup compared to state-of-the-art adversarial attacks.

研究の動機と目的

  • 既存の敵対的攻撃が多数の手動ハイパーパrameterチューニングを必要とし、リアルタイムシステムに不適切であるという非効率性を是正すること。
  • 非順序学習から順序学習タスク、特に敵対的攻撃において未だ未開拓であったシーンテキスト認識にまで、適応的マルチタスク学習を拡張すること。
  • 摂動の大きさと誤分類損失の動的バランスを不確実性推定を用いて自動的に学習する統合的で自動化されたフレームワークの開発。
  • 順序モデル、特にCTCベースのシーケンストランスダクションを用いたモデルに対する適応的攻撃の有効性の評価。
  • 適応的重み学習が攻撃成功率や摂動品質を損なわず、攻撃生成を著しく高速化できることの実証。

提案手法

  • 敵対的攻撃をマルチタスク最適化問題として定式化し、摂動の大きさ(ℓ₂距離)と標的誤分類損失の両方を同時に最小化する。
  • ベイジアンディープラーニングからの不確実性に基づく重み付けを採用し、データ由来のアレアトリック(データ)不確実性とモデル由来のエピステミック(モデル)不確実性の両方を用いて、最適な損失重みを自動で学習する。
  • CTCアライメントプロセスをモデル化し、標的位置(例:挿入、削除、置換ポイント)付近に勾配更新を集中的に焦点化させることで、順序タスクへの応用を実現する。
  • 動的損失重み付けを用いた反復的最適化を採用し、訓練中に不確実性推定に基づいて損失重みを更新することで、手動による探索を回避する。
  • 共有アーキテクチャを用いて、非順序タスク(例:ImageNet)および順序タスク(例:SeqMNIST、シーンテキスト認識)の両方に適用可能である。
  • 摂動は反復的に生成され、標的数字の周辺に勾配が集中し、CTCアライメントを監視することで、敵対的標的への正しいアライメントが保証される。

実験結果

リサーチクエスチョン

  • RQ1不確実性に基づくマルチタスク学習は、シーンテキスト認識のような順序学習タスクにおける敵対的攻撃の高速化に効果的に適用可能か?
  • RQ2固定値λまたは手動チューニングによる重みと比較して、適応的損失重み付けは攻撃成功率と摂動の大きさにおいてどのように異なるか?
  • RQ3提案手法は、C&Wのような反復的攻撃と比較して、著しく短時間で高い攻撃成功率を達成できるか?
  • RQ4異なる敵対的操作(挿入、置換、削除)は攻撃プロセスおよびCTCアライメントダイナミクスにどのように影響を与えるか?
  • RQ5適応的フレームワークは、多様な順序タスクおよびデータセットにおいても頑健性を維持できるか?

主な発見

  • Adaptive Attackは、3つの標準的なシーンテキスト認識ベンチマークで99.9%を超える攻撃成功率を達成し、高い有効性を示した。
  • C&Wのような最先端の反復的攻撃と比較して、攻撃時間を3–6倍短縮し、著しく効率性が向上した。
  • 固定λ値を用いたベースライン手法やバイナリサーチチューニングに比べ、Adaptive Attackは同等またはより優れた摂動品質を達成しながら、はるかに速い収束を示した。
  • CTCアライメントプロセスは100イタレーション以内に素早く安定し、変化は主に標的操作ポイント(例:挿入・削除された数字)付近でのみ観察された。
  • 摂動は初期段階では標的位置の周辺に集中し、後続のイタレーションでは人間が認識できない抽象的で洗練された形に最小化され、依然としてモデルを欺くことができた。
  • 攻撃プロセスの分析から、敵対的摂動がCTC注視メカニズムと整合している場合に最も効果的であり、最適化の全過程にわたりこの整合性が維持された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。