[論文レビュー] Exact Adversarial Attack to Image Captioning via Structured Output Learning with Latent Variables
本論文は、部分的キャプション(キャプション内の一部の単語のみが指定される)を標的とする、画像キャプションシステムに対する最初の正確な敵対的攻撃フレームワークを提案する。この攻撃は、潜在変数を用いた構造的出力学習として定式化される。一般化期待最大化(GEM)と潜在変数を伴う構造的SVMを用いて、人間の目にはほとんど気づかれぬような敵対的ノイズを生成し、最先端のCNN+RNNモデルが標的の、しばしば不適切なキャプションを生成させることに成功する。これは、人間のキャプション作成と比較して、モデルの言語的・構造的理解に深刻な欠落があることを露呈する。
In this work, we study the robustness of a CNN+RNN based image captioning system being subjected to adversarial noises. We propose to fool an image captioning system to generate some targeted partial captions for an image polluted by adversarial noises, even the targeted captions are totally irrelevant to the image content. A partial caption indicates that the words at some locations in this caption are observed, while words at other locations are not restricted.It is the first work to study exact adversarial attacks of targeted partial captions. Due to the sequential dependencies among words in a caption, we formulate the generation of adversarial noises for targeted partial captions as a structured output learning problem with latent variables. Both the generalized expectation maximization algorithm and structural SVMs with latent variables are then adopted to optimize the problem. The proposed methods generate very successful at-tacks to three popular CNN+RNN based image captioning models. Furthermore, the proposed attack methods are used to understand the inner mechanism of image captioning systems, providing the guidance to further improve automatic image captioning systems towards human captioning.
研究の動機と目的
- CNN+RNNベースの画像キャプションモデルが部分的キャプションに対する標的攻撃に対してどれほど頑健であるかを調査すること。
- 特定の位置に特定の語の並びを強制するが、自然言語の構造を保つ敵対的ノイズを生成する課題に対処すること。
- 勾配ベースの手法に容易に適合しない構造的出力に対する正確な攻撃のための体系的なフレームワークを開発すること。
- 攻撃手法をプローブとして用い、画像キャプションモデルの内部メカニズムを分析・理解すること。
- 現在のモデルが、受動態や修飾節といった多様な言語的スタイルを生成する能力にどの程度制限されているかを明らかにすること。
提案手法
- 標的の部分的キャプション攻撃を、潜在変数としての観測されない語を含む構造的出力学習問題として定式化する。
- モデル下での標的部分キャプションの対数周辺尤度を最大化するために、一般化期待最大化(GEM)アルゴリズムを用いる。
- 同じ位置における標的キャプションと他のすべての可能なキャプションとのマージンを最大化するために、潜在変数を伴う構造的SVMを適用する。
- L2ノルムを最小化しつつ、標的キャプションの尤度またはマージンを最大化する敵対的ノイズを最適化する。
- このフレームワークはアーキテクチャに依存せず、任意のCNN+RNN画像キャプションモデルに適用可能である。
- 非標的攻撃の比較のために、射影勾配降下法を用いる。
実験結果
リサーチクエスチョン
- RQ1CNN+RNN画像キャプションモデルに対して、画像とは意味的に無関係であっても、特定の部分的キャプションを強制する敵対的ノイズを生成できるか?
- RQ2潜在変数を伴う構造的出力学習フレームワークは、キャプションのような順序的・構造的出力に対してどのように正確な攻撃を可能にするか?
- RQ3現在の画像キャプションモデルは、敵対的条件下でも受動態や修飾節といった多様な文法的構造をどの程度生成できるか?
- RQ4攻撃の成功・失敗パターンは、画像キャプションにおける深層学習モデルの言語的・構成的理解にどのような示唆をもたらすか?
- RQ5意味的整合性と文法的妥当性の観点から、非標的攻撃と標的攻撃はどのように比較できるか?
主な発見
- 提案されたGEMおよび潜在変数付きSSVM手法は、Show-And-Tell、Show-Attend-And-Tell、SCSTの3つの最先端の画像キャプションモデルに対して敵対的攻撃を成功させた。
- 敵対的ノイズの平均L2ノルムは1.5202(GEM)にまで低く抑えられ、人間の観察者にはほとんど気づかれなかった。
- 攻撃成功率(SR)はGEMで65.86%に達し、Show-and-Foolに比べてSRと精度(0.8009 vs. 0.7239)の両面で顕著に優れていた。
- 唯一、Show-Attend-and-Tellモデルだけが攻撃下で受動態の文を生成できたが、すべてのモデルが修飾節を生成できず、言語的柔軟性に制限があることが示された。
- 非標的攻撃は文法的に誤った意味のないキャプションを生成したため、現在のモデルが自然言語の基本的な文法を学習していないことが示唆された。
- 攻撃フレームワークは、現在のモデルが言語的多様性と構造的理解において人間水準に遠く及ばないことを効果的に暴露した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。