Skip to main content
QUICK REVIEW

[論文レビュー] Fooling Vision and Language Models Despite Localization and Attention Mechanism

Xiaojun Xu, Xinyun Chen|arXiv (Cornell University)|Sep 25, 2017
Multimodal Machine Learning Applications参考文献 60被引用数 9
ひとこと要約

この論文は、アテンション、ローカライゼーション、モジュラー構造を備えた視覚言語モデル—特に密度付きキャプションと視覚的質問応答(VQA)システム—が、複雑な内部構造を有しても、敵対的攻撃に対して依然として極めて脆弱であることを示している。著者らは、白ボックス攻撃手法を新たに開発し、MCB や N2NMN といった最先端モデルを90%以上の成功率でだませることに成功した。これは、アテンション、ボクシングボックスのローカライゼーション、構成的ネットワークが、物理的でない環境下での標的型敵対的例に対して有効な防御を提供しないことを示している。

ABSTRACT

Adversarial attacks are known to succeed on classifiers, but it has been an open question whether more complex vision systems are vulnerable. In this paper, we study adversarial examples for vision and language models, which incorporate natural language understanding and complex structures such as attention, localization, and modular architectures. In particular, we investigate attacks on a dense captioning model and on two visual question answering (VQA) models. Our evaluation shows that we can generate adversarial examples with a high success rate (i.e., > 90%) for these models. Our work sheds new light on understanding adversarial attacks on vision systems which have a language component and shows that attention, bounding box localization, and compositional internal structures are vulnerable to adversarial attacks. These observations will inform future work towards building effective defenses.

研究の動機と目的

  • アテンション、ローカライゼーション、モジュラー構造を備えた高度な視覚言語モデルが敵対的攻撃に対して耐性を示すかどうかを調査すること。
  • 白ボックス条件下での密度付きキャプションおよび VQA モデルに対する敵対的攻撃の有効性を評価すること。
  • 言語的先行知識とモデルアーキテクチャの構成的性質が敵対的耐性に与える影響を分析すること。
  • VQA モデルに対して既存の最先端手法を上回る性能を示す新しい攻撃手法を開発すること。
  • 答えの頻度と意味的整合性が敵対的攻撃成功に与える影響を理解すること。

提案手法

  • 著者らは、勾配に基づく最適化を用いて入力画像を摂動させる、視覚言語モデル向けの標的型白ボックス敵対的攻撃フレームワークを設計した。
  • 攻撃は、特定の答えを標的にし、望ましいラベルに対する信頼度を高める一方で、人間の目で識別できないように最適化する。
  • 敵対的攻撃の成功、画像の摂動、質問との意味的整合性のバランスを取るために、新たな損失関数を導入した。
  • 標準的および意味のない質問-答えペアを用いて、MCB や N2NMN などの複数のモデルに対して攻撃成功率を評価した。
  • 答えの頻度と敵対的確率の相関関係を分析し、モデルの予測可能性と耐性を評価した。
  • 無意味な答えターゲットを用いたアブレーションスタディを実施し、言語的先行知識が攻撃成功率に与える影響を分離した。

実験結果

リサーチクエスチョン

  • RQ1アテンション機構と領域ローカライゼーションを用いた敵対的攻撃が、視覚言語モデルを効果的にだますことができるか?
  • RQ2ニューラルモジュールネットワークのようなモジュラー構造は、標準的なアテンションベースのモデルと比較して、敵対的攻撃に対してより高い耐性を示すか?
  • RQ3言語的先行知識—特に質問と答えの意味的整合性—が敵対的攻撃の成功率に与える影響は何か?
  • RQ4答えの頻度が敵対的攻撃成功確率にどの程度相関しているか?
  • RQ5新規の攻撃手法が、VQA モデルに対して既存の最先端攻撃を上回る性能を示せるか?

主な発見

  • 提案された攻撃は、MCB および N2NMN VQA モデルの両方で90%を超える成功率を達成し、複雑な内部構造を有しても高い有効性を示した。
  • 言語的先行知識が強いモデル、例えば N2NMN はわずかに高い耐性を示し、無意味な答えターゲットを用いた場合、MCB の 7.8% に対して 4.6% の攻撃成功率にとどまった。
  • 答えの頻度と敵対的確率の間に明確な正の相関関係が確認され、頻繁に予測される答えは標的にしやすいことが示された。
  • N2NMN モデルは MCB と比較して、非ゼロ頻度の答えを生成する数が少ないことから、より制限された意味的整合性の高い予測空間を有していると考えられる。
  • 質問と意味的に整合しない答えを標的にした場合、敵対的攻撃の失敗率が顕著に上昇し、言語的先行知識が防御に寄与していることが確認された。
  • アテンションマップや領域提案、モジュラーネットワークの構成でさえも、白ボックス環境下では、敵対的攻撃の成功を防げないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。