[论文解读] No Longer Trending on Artstation: Prompt Analysis of Generative AI Art
本研究利用自然语言处理、主题建模和可视化技术,分析了2022至2023年间来自Stable Diffusion和Midjourney的超过300万条文本到图像的提示,以探究生成式AI如何塑造视觉文化。研究发现,提示设计更注重表面美学和流行风格,尤其是幻想、动漫以及年轻女性的写实描绘,从而强化了文化规范和审美同质化,且大多数用户以休闲而非艺术创作为目的进行使用。
Image generation using generative AI is rapidly becoming a major new source of visual media, with billions of AI generated images created using diffusion models such as Stable Diffusion and Midjourney over the last few years. In this paper we collect and analyse over 3 million prompts and the images they generate. Using natural language processing, topic analysis and visualisation methods we aim to understand collectively how people are using text prompts, the impact of these systems on artists, and more broadly on the visual cultures they promote. Our study shows that prompting focuses largely on surface aesthetics, reinforcing cultural norms, popular conventional representations and imagery. We also find that many users focus on popular topics (such as making colouring books, fantasy art, or Christmas cards), suggesting that the dominant use for the systems analysed is recreational rather than artistic.
研究动机与目标
- 了解用户如何通过文本提示共同塑造生成式AI图像系统中的视觉文化。
- 探究Midjourney和Stable Diffusion等文本到图像(TTI)模型广泛采用所带来的文化、美学与伦理影响。
- 评估生成式AI是否促进了艺术创新,还是强化了现有的视觉刻板印象与风格规范。
- 考察TTI系统对人类艺术家及更广泛的视觉艺术生态系统的冲击。
- 探索提示语言与图像输出如何反映并再现主导的文化与美学惯例。
提出的方法
- 收集并分析了Midjourney(2022年和2023年)与Stable Diffusion的超过300万条提示及其对应的生成图像。
- 应用自然语言处理(NLP)技术,包括使用BERTopic进行主题建模,以及使用UMAP对文本嵌入进行降维。
- 采用cTF-IDF加权与HDBSCAN聚类方法,识别并分类提示与图像描述中的主导主题与风格偏好。
- 对图像输出进行视觉分析,识别重复出现的主题、构图与风格特征,重点关注人物、物体与场景的描绘。
- 比较提示长度、复杂度与主题频率随时间的变化,以评估用户行为与系统可及性的演变。
- 对统计模式进行定性解读,以评估AI生成图像的文化与美学影响。
实验结果
研究问题
- RQ1文本到图像模型中的用户提示在多大程度上反映并强化了主导的文化与美学规范?
- RQ2生成式AI系统在视觉输出中在多大程度上促成了风格的同质化与重复?
- RQ3AI生成图像中的主导主题、主体与艺术风格是什么?它们在2022至2023年间如何演变?
- RQ4基于提示与图像分析,TTI系统的使用在休闲与艺术应用之间有何差异?
- RQ5AI生成的图像在多大程度上反映了或再现了训练数据与用户行为中存在的种族、性别与文化偏见?
主要发现
- 最常见的图像主体为女性(22.26%)、男性(16.2%)、连衣裙(6.92%)、头发(5.51%)、房间(5.44%)和花朵(5.33%),表明对人物形象与个人审美的强烈关注。
- Midjourney用户在2022至2023年间越来越倾向于使用更短的提示,表明系统可及性提高,对专家提示的需求减少。
- 最受欢迎的图像主题为幻想艺术、游戏艺术、动漫插画以及年轻女性的描绘,而‘电影级灯光’与‘超精细’是最常见的风格描述词。
- 大量提示与图像与休闲用途相关,如涂色书与圣诞节主题艺术,尤其在2023年底更为显著。
- 尽管生成图像数量庞大,但其中极少展现出人类艺术所具有的审美独特性或记忆性,表明艺术创新程度有限。
- 本研究结论认为,当前的生成式AI并未构成对人类艺术的严重威胁,因其主要模仿流行风格,缺乏原创性与人类意图。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。