[論文レビュー] What the DAAM: Interpreting Stable Diffusion Using Cross Attention
本稿では、去ノイズU-Netからのクロスアテンションスコアを集約することで、テキストから画像への拡散モデルにおけるピクセル単位の帰属マップを生成するDAAM(Diffusion Attentive Attribution Maps)を提案する。DAAMは、単語が画像のどの領域に影響を与えるかを解釈可能に分析できることを示しており、Stable Diffusionにおける文法的マッピングのパターンや特徴のエンタングルメントを明らかにする。また、セマンティックセグメンテーションとヒューマンエバリュエーションによる定量的検証も実施している。
Large-scale diffusion neural networks represent a substantial milestone in text-to-image generation, but they remain poorly understood, lacking interpretability analyses. In this paper, we perform a text-image attribution analysis on Stable Diffusion, a recently open-sourced model. To produce pixel-level attribution maps, we upscale and aggregate cross-attention word-pixel scores in the denoising subnetwork, naming our method DAAM. We evaluate its correctness by testing its semantic segmentation ability on nouns, as well as its generalized attribution quality on all parts of speech, rated by humans. We then apply DAAM to study the role of syntax in the pixel space, characterizing head--dependent heat map interaction patterns for ten common dependency relations. Finally, we study several semantic phenomena using DAAM, with a focus on feature entanglement, where we find that cohyponyms worsen generation quality and descriptive adjectives attend too broadly. To our knowledge, we are the first to interpret large diffusion models from a visuolinguistic perspective, which enables future lines of research. Our code is at https://github.com/castorini/daam.
研究の動機と目的
- テキストプロンプト内の個々の語が、拡散モデルから生成された画像の特定の領域にどのように影響を与えるかを解釈すること。
- Stable Diffusionにおけるクロスアテンション特徴から、高解像度でピクセル単位の帰属マップを生成する手法を開発すること。
- セマンティックセグメンテーションとヒューマンアノテーションを用いて、語からピクセルへの帰属の正しさと解釈可能性を評価すること。
- 文法的関係(例:主語-述語関係)が、生成された画像空間における視覚的注目パターンにどのようにマッピングされるかを調査すること。
- 共ハイポニムや描写的形容詞によって引き起こされる特徴のエンタングルメントを含む、拡散モデルの失敗モードを分析すること。
提案手法
- DAAMは、Stable Diffusionの去ノイズU-Netからのクロスアテンションスコアをアップスケーリングおよび集約することで、語レベルの帰属マップを計算する。
- 本手法は、テキストトークンと潜在画像トークン間のマルチヘッドクロスアテンション特徴を用い、各語ごとのヒートマップを生成する。
- DAAMマップは、語ベースのセマンティックセグメンテーションタスクにおいてmIoUで評価され、58.9–64.8のmIoUを達成した。
- ヒューマンエバリュエーションは、すべての品詞を対象として実施され、平均意見スコア(MOS)は3.4から4.2の範囲であり、解釈可能で意味的に意味のあるマップであると示された。
- 文法的マッピングは、10の従属関係の種類にわたる主語–従属語の注目マップ相互作用を分析することで調査され、方向性の不均衡が明らかになった。
- 特徴のエンタングルメントは、シーンのレイアウトを固定した上で形容詞を変化させることで調査され、変化が画像全体にわたって伝播する様子が観察された。
実験結果
リサーチクエスチョン
- RQ1テキストプロンプト内の個々の語が、生成された画像の特定の領域にどのように影響を与えるか?
- RQ2Stable Diffusionにおけるクロスアテンションマップが、正確で解釈可能なピクセル単位の帰属をどの程度達成するか?
- RQ3文法的関係(例:主語-述語、修飾語-修飾対象)が、生成された画像空間における視覚的注目パターンにどのようにマッピングされるか?
- RQ4共ハイポニムや描写的形容詞は、拡散モデルの生成における特徴のエンタングルメントにどのような役割を果たすか?
- RQ5DAAMは、関係のない画像領域に過剰に注目するといった、テキストから画像への生成における体系的なバイアスや失敗モードを明らかにできるか?
主な発見
- DAAMは、生成画像のセマンティックセグメンテーションタスクにおいて、mIoUが58.9–64.8に達し、語の注目と真値のオブジェクト領域との強い一致を示した。
- ヒューマンエバリュエーションでは、すべての品詞において平均意見スコア(MOS)が3.4–4.2の範囲であり、DAAMマップが解釈可能で意味的に意味のあるものであると評価された。
- 特定の文法的関係、例えば主語-述語関係では、動詞の注目マップが主語のマップを包含しており、動詞が主語とその周囲の環境を文脈的に統合していることを示唆している。
- 共ハイポニムペア(例:'giraffe and zebra')では、DAAMマップの重複度が増加し、画像品質も悪化しており、共ハイポニミーがエンタングルメントと生成失敗を引き起こすことが示された。
- 『rusty』や『bumpy』のような描写的形容詞は、シーンレイアウトを固定しても、背景領域を含め画像全体にわたって注目が広がることを示しており、非局所的で広範な注目を示している。
- 制御実験では、『blue』、『green』、『red』などの形容詞を変更すると、背景の色や質感が変化し、形容詞修飾語がシーン全体にわたるエンタングルメントを引き起こすことが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。