[論文レビュー] Large-scale Text-to-Image Generation Models for Visual Artists' Creative Works
本研究は、視覚芸術家がDALL-Eのような大規模なテキストto画像生成モデル(LTGM)をクリエイティブワークフローにどのように採用するかを調査する。72件の論文の文献レビューと、35の分野にまたがる28名のアーティストへのインタビューを通じて、自動化、探索、調整の3つのコアな役割を同定し、マルチモーダル入力、プロンプト工学支援、モデルカスタマイズ、可変性制御の調整といった、使いやすさを向上させるための4つのデザインガイドラインを提唱する。
Large-scale Text-to-image Generation Models (LTGMs) (e.g., DALL-E), self-supervised deep learning models trained on a huge dataset, have demonstrated the capacity for generating high-quality open-domain images from multi-modal input. Although they can even produce anthropomorphized versions of objects and animals, combine irrelevant concepts in reasonable ways, and give variation to any user-provided images, we witnessed such rapid technological advancement left many visual artists disoriented in leveraging LTGMs more actively in their creative works. Our goal in this work is to understand how visual artists would adopt LTGMs to support their creative works. To this end, we conducted an interview study as well as a systematic literature review of 72 system/application papers for a thorough examination. A total of 28 visual artists covering 35 distinct visual art domains acknowledged LTGMs' versatile roles with high usability to support creative works in automating the creation process (i.e., automation), expanding their ideas (i.e., exploration), and facilitating or arbitrating in communication (i.e., mediation). We conclude by providing four design guidelines that future researchers can refer to in making intelligent user interfaces using LTGMs.
研究の動機と目的
- 視覚芸術家が大規模なテキストto画像生成モデル(LTGM)をクリエイティブプロセスにどのように統合するかを理解すること。
- LTGMが芸術的ワークフローを支援する際の具体的な役割、たとえば自動化、アイデアの拡張、コミュニケーションの調整といったものを同定すること。
- プロンプト工学、制御性、インターフェース設計の制限によるLTGMの採用に際しての芸術家が直面する課題に対処すること。
- 視覚芸術家がLTGMをより効果的に活用できるようにするための、実行可能なデザインガイドラインを提供すること。
提案手法
- HCI分野における生成モデルに関する72件のシステムおよびアプリケーション論文の体系的レビューを実施し、ユーザー、タスク、役割に関する繰り返し現れるテーマを抽出した。
- 35の異なる視覚芸術分野にまたがる28名の視覚芸術家に対して、半構造化インタビューを実施し、実世界での採用パターンと課題を調査した。
- インタビューデータに対して、文献レビューから導き出されたテーマを基盤とした、従来的および誘導的な二重コーディングアプローチを用いた。
- 芸術的ワークフローにおけるLTGMの繰り返し現れる役割を同定した:繰り返し作業の自動化、新しいアイデアの探索、コミュニケーションの調整。
- 実証的発見に基づいて4つのデザインガイドラインを提唱した:可変性制御、分野特化型のモデルカスタマイズ、マルチモーダル入力支援、プロンプト工学支援。
- 芸術家からのフィードバックの定性的分析を通じて、使いやすさ、制御性、クリエイティブな自律性の観点から、デザインの推奨事項を検証した。
実験結果
リサーチクエスチョン
- RQ1LTGMの使用に最も前向きな視覚芸術家のサブグループはどれで、その採用に影響を与える要因は何ですか?
- RQ2視覚芸術家は、自分のワークフローでLTGMをどのようなクリエイティブタスクに使用していますか?
- RQ3LTGMは視覚芸術家を支援するために、特に自動化、アイデア生成、コミュニケーションの分野でどのような役割を果たしていますか?
- RQ4LTGMが芸術的実践に深く統合されない主な使いやすさの障壁は何ですか?
主な発見
- 視覚芸術家は、初期ドラフトやバリエーションの生成といった繰り返し作業の自動化に、LTGMを価値あるツールとして広く認識している。
- LTGMは、テキストプロンプトから予期しない、あるいは抽象的な視覚的コンセプトを生成することで、創造的アイデーションを拡張するために使用されている。
- 芸術家は、クライアントや共同作業者に芸術的意図を説明する際に、LTGMをコミュニケーションの調整役として重視している。
- 主な制限要因として、プロンプト工学の難易度が挙げられ、多くの芸術家がテキストのみで複雑または抽象的な視覚的アイデアを表現することに苦労している。
- 特に視覚的イメージが鮮明または抽象的である場合に、芸術家は、スケッチ、音声、ジェスチャーなどのマルチモーダル入力による意図の伝達を強く求めている。
- 現在のLTGMインターフェースは、十分な制御性とカスタマイズ性に欠けており、生成された出力が芸術的ビジョンと一致しない場合に、不満を感じている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。