Skip to main content
QUICK REVIEW

[論文レビュー] No Longer Trending on Artstation: Prompt Analysis of Generative AI Art

Jon McCormack, Maria Teresa Llano|arXiv (Cornell University)|Jan 24, 2024
Aesthetic Perception and Analysis被引用数 4
ひとこと要約

本研究では、2022年から2023年の間、Stable DiffusionおよびMidjourneyから得られた300万件を超えるテキストから画像へのプロンプトを自然言語処理(NLP)、トピックモデリング、可視化を用いて分析し、生成的AIが視覚的文化に与える影響を検討した。その結果、プロンプト作成の多くが表面的な美意識や人気のあるスタイル(特にファンタジー、アニメ、若年層の女性の写真的描写)を重視しており、文化的な規範や美的均質性を強化していることが明らかになった。また、大多数のユーザーは芸術的ではなく、娯楽的・遊び目的で利用していることが示された。

ABSTRACT

Image generation using generative AI is rapidly becoming a major new source of visual media, with billions of AI generated images created using diffusion models such as Stable Diffusion and Midjourney over the last few years. In this paper we collect and analyse over 3 million prompts and the images they generate. Using natural language processing, topic analysis and visualisation methods we aim to understand collectively how people are using text prompts, the impact of these systems on artists, and more broadly on the visual cultures they promote. Our study shows that prompting focuses largely on surface aesthetics, reinforcing cultural norms, popular conventional representations and imagery. We also find that many users focus on popular topics (such as making colouring books, fantasy art, or Christmas cards), suggesting that the dominant use for the systems analysed is recreational rather than artistic.

研究の動機と目的

  • ユーザーが生成的AI画像システムにおけるテキストプロンプトを通じて、どのようにして視覚的文化を共同で形成しているかを理解すること。
  • Midjourney や Stable Diffusion などのテキストから画像への(TTI)モデルの広範な採用が、文化的・美的・倫理的な側面に与える影響を調査すること。
  • 生成的AIが芸術的革新を促進しているのか、それとも既存の視覚的ステレオタイプやスタイルの規範を強化しているのかを評価すること。
  • TTIシステムが人間のアーティストや広範な視覚芸術エコシステムに与える影響を検討すること。
  • プロンプトの言語と画像出力が、支配的である文化的・美的慣習をどのように反映し、再現しているかを検討すること。

提案手法

  • Midjourney(2022年および2023年)およびStable Diffusionから、300万件を超えるプロンプトとそれに対応する生成画像を収集・分析した。
  • 自然言語処理(NLP)技術を適用し、テキスト埋め込みの次元削減にUMAPを、トピックモデリングにBERTopicを用いた。
  • cTF-IDF重み付けとHDBSCANクラスタリングを用いて、プロンプトおよび画像の説明における主要なテーマとスタイル的好みを同定・分類した。
  • 画像出力の視覚的分析を実施し、繰り返し現れる被写体、構図、スタイル的特徴を特定した。特に人物、物体、および景観の描写に焦点を当てた。
  • 時間経過に伴うプロンプトの長さ、複雑さ、トピック頻度の変化を比較し、ユーザー行動の変化とシステムのアクセシビリティの変化を評価した。
  • 統計的パターンの定性的な解釈を実施し、AI生成画像の文化的・美的な含意を評価した。

実験結果

リサーチクエスチョン

  • RQ1テキストから画像へのモデルにおけるユーザーのプロンプトは、どのようにして支配的な文化的・美的規範を反映し、強化しているか?
  • RQ2生成的AIシステムは、視覚的出力においてどの程度スタイルの均質化と繰り返しを促進しているか?
  • RQ3AI生成画像における支配的なテーマ、被写体、芸術的スタイルは何か。2022年から2023年にかけてそれらはどのように変化したか?
  • RQ4プロンプトおよび画像分析に基づいて、TTIシステムの使用が娯楽的利用と芸術的利用の間でどのように異なるか?
  • RQ5AI生成画像は、トレーニングデータおよびユーザー行動に存在する人種的・性別的・文化的バイアスを、どのように反映または再現しているか?

主な発見

  • 最も頻出する被写体は女性(22.26%)、男性(16.2%)、ドレス(6.92%)、髪(5.51%)、部屋(5.44%)、花(5.33%)であり、人間の姿と個人的な美的嗜好に強い注目が集まっていることが示された。
  • Midjourneyのユーザーは2022年から2023年にかけて、徐々に短いプロンプトを好む傾向を示しており、アクセシビリティの向上と熟練したプロンプト作成の必要性の低下を示唆している。
  • 画像生成における最も人気のあるトピックはファンタジー芸術、ゲームアート、アニメイラストレーション、若年層の女性の描写であり、『シネマティックライティング』と『ウルトラディテール』が最も一般的なスタイル的特徴であった。
  • プロンプトおよび画像の大部分は、特に2023年後半にかけて、カラーリングブックやクリスマステーマのアートなど、娯楽的利用に関連していた。
  • 膨大な数の生成画像が存在するにもかかわらず、人間が制作する芸術のように独自性や記憶に残る美しさを持つものはほとんどなく、芸術的革新が限定的であることが示唆された。
  • 本研究の結論として、現在の生成的AIは、独自性や人間の意図性に欠ける人気スタイルの模倣にとどまっているため、人間の芸術に対して深刻な脅威とはなっていない。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。