Skip to main content
QUICK REVIEW

[論文レビュー] How Robust is Google's Bard to Adversarial Image Attacks?

Yinpeng Dong, Huanran Chen|arXiv (Cornell University)|Sep 21, 2023
Adversarial Robustness in Machine Learning被引用数 4
ひとこと要約

この論文は、白箱の代替モデル攻撃において22%の成功率で誤った画像説明を引き起こす転送可能な adversarial 画像を生成することで、商用マルチモーダル大規模言語モデル(MLLM)である Google の Bard の adversarial な耐性を評価している。研究では、これらの攻撃が他の MLLM である GPT-4V(45%の成功率)、Bing Chat(26%)、ERNIE Bot(86%)にも一般化することを示しており、顔認識および毒性検出といった Bard の組み込み防御機構が、標的的な摂動によって回避可能であることも明らかにした。

ABSTRACT

Multimodal Large Language Models (MLLMs) that integrate text and other modalities (especially vision) have achieved unprecedented performance in various multimodal tasks. However, due to the unsolved adversarial robustness problem of vision models, MLLMs can have more severe safety and security risks by introducing the vision inputs. In this work, we study the adversarial robustness of Google's Bard, a competitive chatbot to ChatGPT that released its multimodal capability recently, to better understand the vulnerabilities of commercial MLLMs. By attacking white-box surrogate vision encoders or MLLMs, the generated adversarial examples can mislead Bard to output wrong image descriptions with a 22% success rate based solely on the transferability. We show that the adversarial examples can also attack other MLLMs, e.g., a 26% attack success rate against Bing Chat and a 86% attack success rate against ERNIE bot. Moreover, we identify two defense mechanisms of Bard, including face detection and toxicity detection of images. We design corresponding attacks to evade these defenses, demonstrating that the current defenses of Bard are also vulnerable. We hope this work can deepen our understanding on the robustness of MLLMs and facilitate future research on defenses. Our code is available at https://github.com/thu-ml/Attack-Bard. Update: GPT-4V is available at October 2023. We further evaluate its robustness under the same set of adversarial examples, achieving a 45% attack success rate.

研究の動機と目的

  • 白ボックスの adversarial 画像攻撃における、先端的な商用 MLLM である Google の Bard の adversarial な耐性を調査すること。
  • 代替視覚エンコーダーまたは MLLM に対して生成された adversarial 例が、Bard の画像説明機能をだますのにどの程度転送可能かを評価すること。
  • Bard のネイティブな防御機構(顔認識および毒性検出)が adversarial 摂動に対してどの程度有効かを評価すること。
  • 現在の商用 MLLM の防御メカニズムが、洗練された adversarial 攻撃に対して十分に耐性がないことを示すこと。
  • 商用 MLLM のセキュリティリスクについての知見を提供し、耐性のあるマルチモーダル基盤モデルの今後の研究を導くこと。

提案手法

  • 著者たちは、代替モデルを用いた転送ベースの adversarial 攻撃を用い、Bard の視覚エンコーダーおよびテキスト生成パイプラインをだます adversarial 画像を生成した。
  • 2つの目的を最適化した:(1) adversarial 画像の画像埋め込みを元のものからずらすこと(画像埋め込み攻撃)、および (2) 目的のテキスト説明を生成すること(テキスト説明攻撃)。
  • 攻撃は、ε = 16/255 の ℓ∞ 範囲内で摂動を生成する SSA-CWA 法を用いた。
  • 防御回避のため、著者たちは、顔認識および毒性検出システムに使用される事前学習済み視覚モデルの特徴を摂動させることで、Bard の顔認識および毒性検出システムを標的にした攻撃を設計した。
  • 一般化および現実世界への適用性をテストするために、毒性および顔を含むコンテンツを含む多様な 100 枚の実世界画像を用いて攻撃を評価した。
  • 本研究は、モデルの重みやアーキテクチャが不明なブラックボックス設定を想定し、マルチモーダルモデルに適応された最先端の転送ベース攻撃技術を活用した。

実験結果

リサーチクエスチョン

  • RQ1Google の Bard はブラックボックス設定において、どの程度 adversarial 画像攻撃に対して脆弱であるか?
  • RQ2代替モデルに対して生成された adversarial 例は、Bard のマルチモーダル推論および画像説明機能をだますのにどの程度転送可能か?
  • RQ3Bard の組み込み防御機構(顔認識および毒性検出)は、adversarial 摂動によって効果的に回避可能か?
  • RQ4GPT-4V、Bing Chat、ERNIE Bot を含む、他の商用 MLLM と比較して、攻撃成功率はどのように異なるか?
  • RQ5これらの脆弱性は、商用マルチモーダル基盤モデルの安全性とセキュリティにどのような意味を持つのか?

主な発見

  • 攻撃は、Bard が誤った画像説明を生成する adversarial 画像を生成するのに 22% の成功率を達成し、5% の拒否率を示した。
  • 同じ adversarial 例は、GPT-4V では 45%、Bing Chat では 26%、ERNIE Bot では 86% の攻撃成功率を示し、強力な転送性を示した。
  • Bard の顔認識防御は、テストケースの 32% で効果的に回避され、顔を含む adversarial 画像が検出を回避できた。
  • 毒性検出メカニズムは 36% の成功率で回避され、有害な画像が不適切に処理され、不適切な説明が生成された。
  • 結果から、現在の商用 MLLM の防御メカニズムは adversarial 攻撃に対して十分に耐性がないことが示され、顕著なセキュリティリスクが露呈した。
  • 本研究は、Bard のような高性能で広範に展開されているモデルにおいて、adversarial な耐性が依然として重要な課題であることを強調した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。