[論文レビュー] On the Proactive Generation of Unsafe Images From Text-To-Image Models Using Benign Prompts
本稿は、悪意のないプロンプトを用いて、安全でない、憎悪を含むミーム風の画像を生成できる、テキスト対画像モデルに対する最初の能動的ポイズニング攻撃を提示する。概念的に類似したプロンプトを用いてモデルをポイズニングすることで、わずか5サンプルで高い成功率を達成できるが、概念的類似性のため意図しない副作用を引き起こす。ユーティリティを保つ変種は、非標的プロンプトを洗浄することでこの問題を軽減し、FIDスコアの上昇を最大82.47%まで低減する。
Malicious or manipulated prompts are known to exploit text-to-image models to generate unsafe images. Existing studies, however, focus on the passive exploitation of such harmful capabilities. In this paper, we investigate the proactive generation of unsafe images from benign prompts (e.g., a photo of a cat) through maliciously modified text-to-image models. Our preliminary investigation demonstrates that poisoning attacks are a viable method to achieve this goal but uncovers significant side effects, where unintended spread to non-targeted prompts compromises attack stealthiness. Root cause analysis identifies conceptual similarity as an important contributing factor to these side effects. To address this, we propose a stealthy poisoning attack method that balances covertness and performance. Our findings highlight the potential risks of adopting text-to-image models in real-world scenarios, thereby calling for future research and safety measures in this space.
研究の動機と目的
- テキスト対画像モデルが、受動的なプロンプト操作に依存せず、悪意のないプロンプトを用いて能動的に不適切な画像を生成できるかどうかを調査すること。
- 概念的類似性による非標的プロンプトへの影響という、ポイズニングが意図しない副作用を引き起こすリスクに対処すること。
- 攻撃効果を維持しながら、モデルのユーティリティの低下を最小限に抑えることができる、ユーティリティを保つ攻撃を開発すること。
- 副作用を低減するための、概念的に類似したプロンプトの特定と洗浄に関する実用的知見を提供すること。
提案手法
- 標的の憎悪を含むミーム画像とペairedされた悪意のないプロンプトの少量データセットを用いて、テキスト対画像モデルを訓練することで、不適切な生成を誘発する基本的なポイズニング攻撃を提案する。
- 非標的プロンプトを、概念的に類似したが無害なバージョンに置き換えることで、副作用を低減する、ユーティリティを保つ攻撃を導入する。
- Fréchet Inception Distance (FID) を用いてモデルのユーティリティを定量的に評価し、ポイズニングによる劣化を測定する。
- 根本原因分析を通じて、標的プロンプトと非標的プロンプトの間の概念的類似性が、副作用の拡散の主な要因であることを確認する。
- 少ないポイズニングサンプルで攻撃を成功させるために、高インパクトのプロンプトを特定する「ショートカット」プロンプト抽出戦略を適用する。
- MSCOCO検証セットを用いて、多様な非標的プロンプトにおける副作用とユーティリティの保持を評価する。

実験結果
リサーチクエスチョン
- RQ1テキスト対画像モデルは、悪意のないプロンプトのみを用いて、能動的に不適切な画像を生成できるか?
- RQ2非標的プロンプトも不適切な画像生成を引き起こすという、意図しない副作用が生じる要因は何か?
- RQ3ユーティリティを保つプロンプトの洗浄は、攻撃の成功を維持しつつ、どの程度副作用を低減できるか?
- RQ4プロンプト間の概念的類似性は、ポイズニング効果の拡散にどのように影響するか?
- RQ5たとえば5個の最小サンプルで、効果的な攻撃性能を達成できるか?
主な発見
- 基本的なポイズニング攻撃は、わずか5個のポイズニングサンプルで標的の憎悪を含むミームを生成でき、テキスト対画像モデルの高い脆弱性を示している。
- 攻撃は顕著な副作用を引き起こしており、プロンプト間の概念的類似性のため、非標的プロンプトに対しても不適切な画像が生成されている。
- 根本原因分析により、標的プロンプトと非標的プロンプトの間の概念的類似性が、副作用の拡散の主要因であることが確認された。
- ユーティリティを保つ攻撃は、基本攻撃と比較してFIDスコアの上昇を最大82.47%まで低減した。特に「ハッピー・マーチャント」ミームを含む最悪ケースにおいて顕著だった。
- 「ショートカット」プロンプト抽出戦略により、効果的な行動を誘発する高インパクトプロンプトを特定することで、少ないサンプルで攻撃を成功させた。
- 概念的に類似したプロンプトを1つ洗浄するだけで、複数の非標的プロンプトにおける副作用を低減でき、セマンティック類似性がポイズニングの拡散に与える影響を示している。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。