[論文レビュー] Diffusion Models for Counterfactual Explanations
この論文では、微調整を伴わずに、事前学習済みの拡散モデルを活用して画像分類器の反事実的説明を生成する新規手法DiMEを提案する。分類器勾配を用いて拡散プロセスをガイドすることで、現実的で多様かつ最小限の摂動を持つ反事実的画像を生成し、CelebAデータセットにおいて6つの指標のうち5つで先行する最先端手法を上回る性能を発揮する。また、誤った相関関係の検出をよりよく評価するため、新たな指標「相関差(Correlation Difference)」を導入した。
Counterfactual explanations have shown promising results as a post-hoc framework to make image classifiers more explainable. In this paper, we propose DiME, a method allowing the generation of counterfactual images using the recent diffusion models. By leveraging the guided generative diffusion process, our proposed methodology shows how to use the gradients of the target classifier to generate counterfactual explanations of input instances. Further, we analyze current approaches to evaluate spurious correlations and extend the evaluation measurements by proposing a new metric: Correlation Difference. Our experimental validations show that the proposed algorithm surpasses previous State-of-the-Art results on 5 out of 6 metrics on CelebA.
研究の動機と目的
- 画像分類器の意思決定に対して、現実的で最小限の摂動かつ多様な変更を生成する後処理型の反事実的説明手法を開発すること。
- 拡散モデルが持つ性質(確率的性質や多段階の潜在空間)を活用して、意味的に意味のある反事実的編集を生成すること。
- 既存の評価指標の限界を是正するため、誤った相関関係の検出に適した新たな指標「相関差(Correlation Difference)」を導入すること。
- 微調整や条件付きファインチューニングを伴わず、無条件の拡散モデルを反事実的説明に効果的に再利用できることを示すこと。
提案手法
- DiMEは、ターゲット分類器からの勾配を用いて逆方向のノイズ除去プロセスをガイドすることで、事前学習済みの無条件のノイズ除去拡散確率的モデル(DDPM)を用いて反事実的画像を生成する。
- 本手法は、複数のノイズ除去段階で分類器勾配を拡散モデルの潜在空間に適用し、モデルの予測を変化させつつも画像構造を保持する意味的な編集を可能にする。
- 画像の忠実性を向上させるために、知覚的損失(perceptual loss)を統合し、生成された反事実的画像が現実的で知覚的に妥当であることを保証する。
- 反事実的データに対する再学習や条件付けを避けており、代わりに1つの事前学習済みモデルからの勾配ガイドドサンプリングに依存する。
- 本手法は、標準指標(FID、FVA、MNAC)に加え、新たな指標「相関差(Correlation Difference)」を用いて、画像品質と誤った相関関係の検出能力の両方を評価する。
- ノイズレベルの初期化や損失重みの影響を分析するためのアブレーションスタディを実施し、生成パイプラインにおける設計選択の妥当性を検証する。

実験結果
リサーチクエスチョン
- RQ1微調整なしに、事前学習済みの拡散モデルを高品質で現実的な反事実的説明の生成に効果的に再利用できるか?
- RQ2分類器勾配を用いたガイドド拡散プロセスは、従来の条件付き生成法や敵対的生成法と比較して、反事実的品質や多様性においてどのように優れているか?
- RQ3FID や MNAC といった既存の評価指標は、反事実的説明が誤った相関関係を検出できる能力をどれほど正確に反映しているか?
- RQ4新たな指標「相関差(Correlation Difference)」は、従来の手法と比較して、反事実的説明における微細な誤った相関関係をよりよく捉えられるか?
主な発見
- DiMEは、CelebAデータセットにおいて6つの指標のうち5つで最先端の性能を達成し、特に『笑顔(Smile)』属性ではFID、FVA、MNACで、『若々しさ(Young)』属性ではFIDとMNACで、先行手法を上回った。
- 提案された「相関差(Correlation Difference)」指標は、既存の指標(例:MNAC)が反事実的画像における微細な誤った相関関係を検出できない場合に、誤った正確さの錯覚を与える可能性があることを示した。
- アブレーションスタディの結果、DiMEの完全版は、単純な勾配ガイドドベースラインや直接勾配ガイドドベースラインと比較して、忠実性と忠実性の両面で顕著に優れており、ガイドド拡散プロセスにおける提案された精錬手法の重要性を裏付けた。
- 計算コストが非常に高い(1つの反事実的生成に約1800回の順方向プロパゲーションを要するが)、DiMEは顔の表情や年齢の外見の変更といった多様で意味的に意味のある編集を生成し、構造的一致性を維持した。
- 定性的な結果から、DiMEは、笑顔の変更や年齢の変化といった知覚的に明確な変化を生成しており、手やペンダントなどの分布外要因に対しても、元のアイデンティティや構造を保持していることが示された。
- 無条件のFIDはDiMEのそれよりも高いことから、知覚的損失とガイドド生成が、無条件サンプリングよりも画像品質を向上させていることが示された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。