Skip to main content
QUICK REVIEW

[論文レビュー] The Creativity of Text-to-Image Generation

Jonas Oppenlaender|arXiv (Cornell University)|May 13, 2022
Data Visualization and Analytics被引用数 4
ひとこと要約

本論文は、従来の製品中心の創造的視点が、テキストから画像を生成する分野における人間の創造的活動の全貌を捉えていないと主張し、代わりにローズの「4Pモデル」(製品、人物、プロセス、プレス)を用いたプロセスおよび文脈中心の視点を提唱する。プロンプト工学とオンラインコミュニティが創造的実践の中心であると強調し、創造性が最終的な画像出力に限らず、人間とAIの相互作用およびコミュニティ主導の学びのプロセスから生じることを示している。

ABSTRACT

Text-guided synthesis of images has made a giant leap towards becoming a mainstream phenomenon. With text-to-image generation systems, anybody can create digital images and artworks. This provokes the question of whether text-to-image generation is creative. This paper expounds on the nature of human creativity involved in text-to-image art (so-called "AI art") with a specific focus on the practice of prompt engineering. The paper argues that the current product-centered view of creativity falls short in the context of text-to-image generation. A case exemplifying this shortcoming is provided and the importance of online communities for the creative ecosystem of text-to-image art is highlighted. The paper provides a high-level summary of this online ecosystem drawing on Rhodes' conceptual four P model of creativity. Challenges for evaluating the creativity of text-to-image generation and opportunities for research on text-to-image generation in the field of Human-Computer Interaction (HCI) are discussed.

研究の動機と目的

  • テキストから画像を生成する分野における創造的定義を、最終出力の独自性と効果性に限定する製品中心の定義に反論すること。
  • テキストから画像を生成するアートにおける創造的プロセスは、出力の評価だけでは捉えきれないこと、人間とAIの相互作用およびコミュニティの文脈に注目する必要があることを示すこと。
  • オンラインコミュニティが、プロンプト工学やキュレーションといった新しい創造的実践を形作り、支援する役割を果たしていることを強調すること。
  • AI生成アートにおける創造性を評価する枠組みを、出力に加え、プロセス、人物、プレス(環境)を含む方向へ転換すべきだと提唱すること。
  • プロンプト工学とコミュニティ協働を支援する共創的システムの設計に向けたHCI研究の機会を同定すること。

提案手法

  • 人間の創造的活動を分析するための概念的枠組みとして、ローズの「4Pモデル」(製品、人物、プロセス、プレス)を採用した。
  • プロンプト工学をコアな創造的実践とみなし、反復的改善と実験を含むプロセスに注目して、テキストから画像を生成するアート作成の事例研究を分析した。
  • オンラインコミュニティ(例:Midjourney、Colab、ソーシャルメディア)が、知識共有、フィードバックループ、集団的学びを可能にする重要な「プレス」要因として果たす役割を検討した。
  • 画像レベルおよびポートフォリオレベルのキュレーションを、創造的行為として分析し、アーティストの意図、美的判断、進化するスタイルを反映している点を明らかにした。
  • 大規模言語モデル(例:GPT-3)における自然言語プロンプトとの類似性を検討し、テキストから画像を生成するシステムにおけるプロンプト工学の設計原則を導いた。
  • 今後のHCI研究は、MindsEyeやコミュニティ主導のプロンプトテンプレートを含む、共創的ワークフローを支援するユーザインターフェースやツールの開発に注力すべきだと提言した。

実験結果

リサーチクエスチョン

  • RQ1製品中心の創造的視点は、テキストから画像を生成する分野における人間の創造的活動の全貌をどのように捉えきれないのであるか?
  • RQ2オンラインコミュニティは、テキストから画像を生成するアートにおけるプロンプト工学などの創造的プロセスや実践を、どのように形作っているのか?
  • RQ3人間とAIシステムとの相互作用は、最終的な画像出力以上の意味を持つ共創の形態をどのように形成しているのか?
  • RQ4「4Pモデル」(製品、人物、プロセス、プレス)をAI生成アートにおける創造性の理解と評価にどう応用できるか?
  • RQ5テキストから画像を生成する分野におけるプロンプト工学と協働的創造性を支援するシステムの設計に向けたHCI研究における機会は何か?

主な発見

  • 最終画像の独自性と効果性を要件とする製品中心の創造的定義は、プロンプト工学や反復的改善に伴う創造的労働を十分に反映していない。
  • テキストから画像を生成する分野における創造性は、画像出力に限定されるのではなく、試行錯誤とコミュニティからのフィードバックを経てプロンプトを構築・改善するプロセスに深く根ざしている。
  • オンラインコミュニティは、4Pモデルにおける「プレス」要因として不可欠であり、共有リソース、テンプレート、協働学びの環境を提供することで、創造的実践を形作っている。
  • 画像レベルおよびポートフォリオレベルのキュレーションは、アーティストの美的判断と進化するアイデンティティを反映する重要な創造的行為であり、プロンプト作成を越えて創造性を拡張している。
  • プロンプト工学は、オンラインコミュニティ内で実践される明確な創造的技芸として登場しており、伝統的な芸術的技法とは異なりながらも、AIとの自然言語インタラクションに適応した形で進化している。
  • テキストから画像を生成する技術の台頭は、写真の歴史的影響に類似した社会的創造生産の転換を示唆しており、デジタル時代における著作者性、スキル、創造性の定義に影響を与える可能性を秘めている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。