Skip to main content
QUICK REVIEW

[論文レビュー] Mitigating Inappropriateness in Image Generation: Can there be Value in Reflecting the World's Ugliness?

Manuel Brack, F. Friedrich|arXiv (Cornell University)|May 28, 2023
Artificial Intelligence in Games被引用数 5
ひとこと要約

本稿では、明示的なテキスト指示—具体的にはセマンティックガイダンス(SEGA)とネガティブプロンプティング—を用いて、テキストから画像への拡散モデルにおける不適切な画像生成を軽減する手法を調査している。モデルが学習した「世界の不快さ」の表現を活用することで、著者らは、11のオープンソースモデルにおいて、推論時における干渉が不適切なコンテンツの生成確率を顕著に低下させることを示している。SEGAはネガティブプロンプティングよりも、不適切な出力を抑制する上でより効果的であることが判明した。

ABSTRACT

Text-conditioned image generation models have recently achieved astonishing results in image quality and text alignment and are consequently employed in a fast-growing number of applications. Since they are highly data-driven, relying on billion-sized datasets randomly scraped from the web, they also reproduce inappropriate human behavior. Specifically, we demonstrate inappropriate degeneration on a large-scale for various generative text-to-image models, thus motivating the need for monitoring and moderating them at deployment. To this end, we evaluate mitigation strategies at inference to suppress the generation of inappropriate content. Our findings show that we can use models' representations of the world's ugliness to align them with human preferences.

研究の動機と目的

  • 最先端のテキストから画像への拡散モデルにおける不適切なコンテンツ生成の程度を体系的に評価すること。
  • 推論時における指示手法—特にSEGAとネガティブプロンプティング—が、このようなコンテンツを抑制する効果があるかどうかを評価すること。
  • 多様なモデルとアーキテクチャをカバーする安全対策戦略の、大規模かつ定量的なベンチマークを提供すること。
  • モデルの内部表現である「不快さ」を活用して、生成を人間の安全性の好みに一致させられるかどうかを検討すること。
  • 再トレーニングやデータフィルタリングにかかるコストを回避する、柔軟で実用的なリアルタイムモデレーションソリューションを提供すること。

提案手法

  • 著者らは、11のオープンソーステキストから画像へのモデルを対象に、150万枚を超える画像を生成する大規模な評価フレームワークを用いた。
  • 2つの指示ベースの緩和戦略を適用した:セマンティックガイダンス(SEGA)は、望ましくないコンセプトから逸脱するように生成を誘導するためのステアリング項を追加する。ネガティブプロンプティングは、非条件付きノイズ除去ステップを抑制プロンプトで条件づける。
  • 不適切なコンテンツの生成をテストするために、I2P(不適切な画像プロンプト)データセットを用いてプロンプトを提示した。
  • 不適切なコンテンツは、確率と予想される最大不適切度を測定するために、組み合わせたQ16/NudeNet分類器を用いて分類された。
  • 外部分類器を必要としない条件付き生成を可能にするために、分類器フリー・ガイドランスを基本メカニズムとして用いた。
  • 評価には、各モデルあたり25のプロンプトごとの不適切度の期待最大値のブートストラップ推定が含まれた。
Figure 1 : Examples of inappropriate degeneration and their mitigation across various models. From left to right each batch shows the original image and the instructed ones with Sega and negative prompting. Prompts are taken from the inappropriate-image-prompts (I2P) dataset. Images displaying nudit
Figure 1 : Examples of inappropriate degeneration and their mitigation across various models. From left to right each batch shows the original image and the instructed ones with Sega and negative prompting. Prompts are taken from the inappropriate-image-prompts (I2P) dataset. Images displaying nudit

実験結果

リサーチクエスチョン

  • RQ1現在のテキストから画像への拡散モデルは、曖昧または明示的なプロンプトに対して、どの程度不適切なコンテンツを生成するのか?
  • RQ2SEGAとネガティブプロンプティングは、多様なモデルとアーキテクチャにおいて、不適切な画像の生成を効果的に低減できるか?
  • RQ3SEGAとネガティブプロンプティングは、コンテンツ抑制の効果と制御性の観点から、どのように比較できるか?
  • RQ4モデルの内部表現である「不快さ」を活用して、画像生成を人間の安全性の好みに一致させられるか?
  • RQ5実世界の展開シナリオにおいて、指示ベースの緩和戦略はスケーラビリティと一般化性を備えているか?

主な発見

  • 本研究では、11のオープンソーステキストから画像へのモデルにおいて、不適切なコンテンツ生成が広範にわたる問題であることが示された。非明示的なプロンプトからでも、不適切な画像の生成確率が非常に高かった。
  • SEGAは不適切なコンテンツの生成確率を顕著に低減した。性的な分野およびすべての不適切さのカテゴリーにおいて、ネガティブプロンプティングを上回る効果を示した。
  • SEGAを用いることで、予想される最大不適切度が著しく低下し、1つのプロンプトセットあたり少なくとも1度は不適切な画像が生成される可能性が顕著に減少していることが示された。
  • ネガティブプロンプティングも不適切さを低減するが、制御性に欠け、特に曖昧または内蔵された形での不適切なコンテンツの抑制において、SEGAほど効果的ではなかった。
  • 結果から、推論時における指示ベースの緩和は、データフィルタリングやファインチューニングに比べ、スケーラブルで柔軟な代替策であり、計算コストの増加も最小限に抑えられることを示した。
  • 組み合わせたQ16/NudeNet分類器は保守的なベースラインを示しており、実際の不適切さは報告より低く抑えられている可能性があるが、緩和効果のトレンドは依然として頑健であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。