Skip to main content
QUICK REVIEW

[論文レビュー] Bad Characters: Imperceptible NLP Attacks

Nicholas Boucher, Ilia Shumailov|arXiv (Cornell University)|Jun 18, 2021
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

本論文は、視認できない文字、同形文字、再配置、削除攻撃を用いた、視覚的検出を回避するがモデル出力を操作する、インペリセプティブルNLP攻撃の体系的分析を提示する。視覚的検出を回避しつつ、100%のインビジブル文字、再配置、削除攻撃を緩和するOCRベースの防御を提案。同形文字攻撃の成功率も顕著に低下させ、BLEUスコアに6.2%のコストを伴うが、モデル再訓練を必要とせず、後から適用可能な低コストな防御を提供する。

ABSTRACT

Several years of research have shown that machine-learning systems are vulnerable to adversarial examples, both in theory and in practice. Until now, such attacks have primarily targeted visual models, exploiting the gap between human and machine perception. Although text-based models have also been attacked with adversarial examples, such attacks struggled to preserve semantic meaning and indistinguishability. In this paper, we explore a large class of adversarial examples that can be used to attack text-based models in a black-box setting without making any human-perceptible visual modification to inputs. We use encoding-specific perturbations that are imperceptible to the human eye to manipulate the outputs of a wide range of Natural Language Processing (NLP) systems from neural machine-translation pipelines to web search engines. We find that with a single imperceptible encoding injection -- representing one invisible character, homoglyph, reordering, or deletion -- an attacker can significantly reduce the performance of vulnerable models, and with three injections most models can be functionally broken. Our attacks work against currently-deployed commercial systems, including those produced by Microsoft and Google, in addition to open source models published by Facebook, IBM, and HuggingFace. This novel series of attacks presents a significant threat to many language processing systems: an attacker can affect systems in a targeted manner without any assumptions about the underlying model. We conclude that text-based NLP systems require careful input sanitization, just like conventional applications, and that given such systems are now being deployed rapidly at scale, the urgent attention of architects and operators is required.

研究の動機と目的

  • Unicode制御文字および同形文字を用いて視覚的変更なしにNLPモデル出力を操作するインペリセプティブルなテキスト攻撃を同定・分類すること。
  • これらの攻撃が機械翻訳、センチメント分析、有害コンテンツ検出といった重要なNLPタスクで、既存のNLPシステムを回避できることを実証すること。
  • 特にOCRベースおよびBidiアルゴリズムベースの解決策を含む、実用的で後から適用可能な防御(リトレーニング不要)を開発・評価し、パフォーマンス劣化を最小限に抑えること。
  • 生産環境のNLPシステムにこうした防御を統合するよう提言し、スケールに応じた敵対的摂動に対する耐性を確保すること。

提案手法

  • テキストエンコーディングの特徴に基づく、インペリセプティブル攻撃の分類法を提案:インビジブル文字、同形文字、バイディレクショナル(Bidi)制御文字、ソフト/ハード削除文字。
  • 視覚的に似ているが意味的に異なる文字(例:同形文字)を、標準的な同等物にマッピングするために光学的文字認識(OCR)を活用し、攻撃表面を縮小。
  • テキストの論理的順序を解消するため、Unicodeバイディレクショナルアルゴリズムを適用し、視覚的レンダリングと論理的順序の不一致を悪用する再配置攻撃に対抗。
  • 削除文字およびBidi制御文字のストリッピングまたは警告を実施することで、入力のクリーニング処理を実装(可能な範囲で)。
  • 防御の影響を評価するため、BLEUスコアを用いて、元の入力および同形文字で改ざんされた入力におけるモデルパフォーマンスの影響を測定。
  • 機械翻訳、センチメント分析、NER、テキスト帰属関係、有害コンテンツ検出といった複数のNLPタスクで防御を評価。

実験結果

リサーチクエスチョン

  • RQ1インペリセプティブルなテキスト攻撃は、Unicode制御文字および同形文字をどのように活用し、視覚的外観を変更せずにNLPモデル出力を操作するのか?
  • RQ2OCRベースの前処理は、NLP推論パイプラインにおける同形文字およびインビジブル文字攻撃をどの程度緩和できるか?
  • RQ3実世界のNLPシステムにOCRまたはBidi解消処理を適用する際、防御効果とモデルパフォーマンスのトレードオフはどの程度か?
  • RQ4モデル再訓練を伴わない一般化された防御は、広範なNLP攻撃クラスに対して有効であり、モデルの正確性を損なわずに機能するのか?
  • RQ5特にBidi制御文字の処理に関して、グラフィカルユーザーインターフェースを備えたシステムとそうでないシステムにおいて、どの防御戦略が最も適しているか?

主な発見

  • OCRベースの防御は、推論の前段階でテキストを正規化することで、インビジブル文字、再配置、削除攻撃の100%を効果的にブロックした。
  • 同形文字攻撃の成功率は顕著に低下したが、稀なまたは曖昧な同形文字のOCR認識の不完全さにより、完全には防止できなかった。
  • 防御はベースラインのBLEUスコアを6.2%低下させたが、主に元のテキストにおけるOCRエラーと、同形文字の高い誤認識率が要因であった。
  • Bidiアルゴリズムによる処理は、論理的テキスト順序を視覚的レンダリング順序と一致させることで、再配置攻撃を効果的に防止した。
  • 提案された防御は、機械翻訳、センチメント分析、有害コンテンツ検出を含む多様なNLPタスクで有効であった。
  • 著者らは、OCRベースの前処理が、モデル再訓練を必要とせず、低コストで後から適用可能な解決策であり、耐性を高めることを結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。