Skip to main content
QUICK REVIEW

[论文解读] Unmaking AI Imagemaking: A Methodological Toolkit for Critical Investigation

Luke Munn, Liam Magee|arXiv (Cornell University)|Jul 19, 2023
Aesthetic Perception and AnalysisNeuroscience被引用 3
一句话总结

本文提出一个三管齐下的方法论工具包——解构生态系统、解构数据、解构输出——以批判性地探究生成式AI图像模型(如Stable Diffusion)。通过分析生产激励、训练数据偏见以及通过迭代提示揭示的生成输出,该框架揭示了这些模型如何再现社会刻板印象与权力失衡,为政治与社会敏感的AI研究奠定了基础。

ABSTRACT

AI image models are rapidly evolving, disrupting aesthetic production in many industries. However, understanding of their underlying archives, their logic of image reproduction, and their persistent biases remains limited. What kind of methods and approaches could open up these black boxes? In this paper, we provide three methodological approaches for investigating AI image models and apply them to Stable Diffusion as a case study. Unmaking the ecosystem analyzes the values, structures, and incentives surrounding the model's production. Unmaking the data analyzes the images and text the model draws upon, with their attendant particularities and biases. Unmaking the output analyzes the model's generative results, revealing its logics through prompting, reflection, and iteration. Each mode of inquiry highlights particular ways in which the image model captures, "understands," and recreates the world. This accessible framework supports the work of critically investigating generative AI image models and paves the way for more socially and politically attuned analyses of their impacts in the world.

研究动机与目标

  • 为解决当前缺乏批判性、可及的方法来探究生成式AI图像模型的社会技术运作机制的问题。
  • 通过开发跨学科的方法论框架,挑战围绕AI图像模型的模糊性与神话化现象。
  • 使研究人员能够通过系统性探究,揭示训练数据、模型架构与生成输出中嵌入的偏见。
  • 支持超越技术评估的更广泛政治与伦理参与,以应对AI图像生成问题。
  • 提供一种灵活且可适应的工具包,适用于不同模型,尤其是Stable Diffusion等开源模型,尽管其透明度水平各异。

提出的方法

  • 解构生态系统:分析模型开发背后的商业、制度与激励结构,包括企业所有权、资金来源与组织目标。
  • 解构数据:调查训练数据(文本-图像对)的构成、来源与偏见,突出历史与文化失衡如何被编码进模型行为之中。
  • 解构输出:通过迭代提示、反思与基于界面的实验,揭示生成图像中模型的逻辑、刻板印象与审美倾向。
  • 整合批判性AI研究、数字方法与媒体研究的方法,实现对AI图像模型的全面、社会技术性分析。
  • 采用案例研究方法,以Stable Diffusion作为代表性开源模型,展示该工具包的适用性。
  • 强调方法论多元性与“解释性污染”——融合多样研究传统,以避免简化的技术分析或纯粹文化分析。

实验结果

研究问题

  • RQ1围绕AI图像模型开发的商业与制度结构在多大程度上塑造了其设计与部署?
  • RQ2生成式图像模型的训练数据中存在哪些偏见与表征模式?它们如何反映历史上的权力失衡?
  • RQ3提示策略如何揭示模型在图像生成中的底层逻辑、审美偏好与刻板印象倾向?
  • RQ4生成式输出在何种方式下再现或挑战了视觉文化中既有的性别化、种族化与性向化刻板印象?
  • RQ5研究人员如何发展出一种批判性、多维的理解,以同时涵盖技术、文化和政治维度?

主要发现

  • 当提示为“nurse”(护士)时,Stable Diffusion主要生成白人、年轻且具有古典美感的女性形象,揭示其输出中存在强烈的性别化与种族化刻板印象。
  • 在提示中加入“hyperrealistic”(超现实)与“4k”会生成一种混合美学,融合摄影、数字艺术与3D渲染,表明模型具有特定的风格倾向。
  • 针对“threatening face”(威胁性面孔)或“friendly face”(友好面孔)的提示,始终生成反映现有社会偏见的图像,包括种族与性别化的夸张形象。
  • 非顺性别身份在生成图像中系统性地被表现为更不具人性、更具性暗示性且更刻板化,表明深层的表征不公。
  • 迭代提示与反思揭示,模型并非生成中性或客观的表征,而是复制并放大了既有的文化规范。
  • 该工具包成功揭示了AI图像模型并非中立工具,而是反映并强化了其训练数据与开发生态系统中嵌入的结构性不平等。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。