Skip to main content
QUICK REVIEW

[論文レビュー] Towards Safe Self-Distillation of Internet-Scale Text-to-Image Diffusion Models

Sanghyun Kim, Seohyeon Jung|arXiv (Cornell University)|Jul 12, 2023
Generative Adversarial Networks and Image Synthesis被引用数 5
ひとこと要約

本稿では、テキストから画像への拡散モデルを自己蒸留によって微調整するSafe Self-Distillation Diffusion (sdd)を提案する。この手法により、性的な内容やアーティスト特有のスタイルといった有害または著作権侵害の恐れのあるコンテンツを、ターゲットコンセプトのノイズ予測を無条件モデルの出力と一致させることで除去する。sddは、画像品質を維持したまま複数のコンセプトを同時に除去でき、安全性と忠実度の両面で先行手法を上回る。

ABSTRACT

Large-scale image generation models, with impressive quality made possible by the vast amount of data available on the Internet, raise social concerns that these models may generate harmful or copyrighted content. The biases and harmfulness arise throughout the entire training process and are hard to completely remove, which have become significant hurdles to the safe deployment of these models. In this paper, we propose a method called SDD to prevent problematic content generation in text-to-image diffusion models. We self-distill the diffusion model to guide the noise estimate conditioned on the target removal concept to match the unconditional one. Compared to the previous methods, our method eliminates a much greater proportion of harmful content from the generated images without degrading the overall image quality. Furthermore, our method allows the removal of multiple concepts at once, whereas previous works are limited to removing a single concept at a time.

研究の動機と目的

  • インターネット規模のテキストから画像への拡散モデルにおける有害および著作権侵害の恐れのあるコンテンツ生成の課題に対処すること。
  • 画像品質の低下や深刻な忘却を引き起こさずに、問題のあるコンセプトを除去する手法を開発すること。
  • 単一コンセプト手法の制限を克服し、複数の有害または著作権侵害の恐れのあるコンセプトを同時に除去できること。
  • 実世界での生成モデルの展開に適した安全で効率的かつデプロイ可能なトレーニング後処理ソリューションを提供すること。

提案手法

  • 本手法は、ターゲットコンセプトのノイズ予測を無条件モデルの出力と一致させるために、テキストプロンプトを用いて蒸留プロセスを誘導する自己蒸留を実行する。
  • トレーニングの安定化と微調整中の深刻な忘却の軽減を図るため、指数的移動平均(EMA)教師モデルを採用する。
  • 学生モデルは、ターゲットコンセプトのプロンプトを条件として、潜在空間におけるノイズ予測を最適化するが、同時にEMA教師モデルの無条件予測と一致させる。
  • 本手法は事前学習後に行われるため、元の学習データにアクセスする必要がなく、実用環境におけるモデル微調整に適している。
  • 複数のターゲットコンセプトに対して蒸留プロセスを逐次的または同時に適用することで、複数コンセプトの除去を可能にする。
  • トレーニング目的は、学生モデルのノイズ予測とEMA教師モデルの無条件予測との間のL2距離を最小化することで、過学習を避けるとともに一致を確保する。

実験結果

リサーチクエスチョン

  • RQ1自己蒸留を用いることで、画像品質の低下を伴わず、テキストから画像への拡散モデルから有害なコンテンツを効果的に除去できるか?
  • RQ2本手法は、既存のトキシシティ除去技術と比較して、安全性と忠実度の両面で優れているか?
  • RQ3本手法は、1回の微調整プロセスで複数の有害または著作権侵害の恐れのあるコンセプト(例:ヌードやアーティストのスタイル)を同時に除去できるか?
  • RQ4EMA教師モデルの使用が、コンセプト除去中に深刻な忘却をどの程度防止できるか?
  • RQ5微調整後も、関連のないプロンプトに対して多様で高品質な画像を生成する能力が、モデルで保持されるか?

主な発見

  • sddは、ベースのStable Diffusionモデルで74.18%であったNSFW(ヌード)画像の割合を、5,000枚のベンチマークで12.62%まで低下させ、既存手法を顕著に上回った。
  • 本手法は高い画像品質を維持しており、Frechet Inception Distance (FID) が15.142に達し、esd や sld などの他の手法と同等またはそれ以上の性能を示した。
  • sddは、生成画像からアーティスト特有のスタイル(例:ヴァン・ゴッホのスタイル)を効果的に除去しながら、プロンプトのコアな内容と芸術的意図を保持した。
  • sd+neg や sld のような単一コンセプト手法とは異なり、sddは複数コンセプトを同時に除去する際も強力な性能を維持し、他のアプローチで見られる性能低下を回避した。
  • EMA教師モデルは、一般知識を効果的に保持し、複数のコンセプトを除去しても画像品質の低下を防ぐのに効果的であった。
  • 本手法は安定的かつ高速なトレーニングを示しており、蒸留プロセス中に異なるコンセプト同士の干渉が最小限に抑えられていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。