[논문 리뷰] Unmaking AI Imagemaking: A Methodological Toolkit for Critical Investigation
이 논문은 Stable Diffusion과 같은 생성형 AI 이미지 모델을 비판적으로 조사하기 위한 세 가지 요소로 구성된 방법론적 툴킷—'생태계 해체', '데이터 해체', '출력 해체'—을 제안한다. 반복적 프롬프팅을 통해 제작 인센티브, 훈련 데이터의 편향, 생성 출력의 특성을 분석함으로써, 이 틀은 이러한 모델이 사회적 스테레오타입과 권력 불균형을 어떻게 재생산하는지 드러내며, 정치적·사회적으로 민감한 AI 연구의 기초를 제공한다.
AI image models are rapidly evolving, disrupting aesthetic production in many industries. However, understanding of their underlying archives, their logic of image reproduction, and their persistent biases remains limited. What kind of methods and approaches could open up these black boxes? In this paper, we provide three methodological approaches for investigating AI image models and apply them to Stable Diffusion as a case study. Unmaking the ecosystem analyzes the values, structures, and incentives surrounding the model's production. Unmaking the data analyzes the images and text the model draws upon, with their attendant particularities and biases. Unmaking the output analyzes the model's generative results, revealing its logics through prompting, reflection, and iteration. Each mode of inquiry highlights particular ways in which the image model captures, "understands," and recreates the world. This accessible framework supports the work of critically investigating generative AI image models and paves the way for more socially and politically attuned analyses of their impacts in the world.
연구 동기 및 목표
- 생성형 AI 이미지 모델의 사회기술적 작동 방식을 비판적으로 접근하고 접근 가능한 방법이 부족한 데 대응하기 위해.
- AI 이미지 모델의 투명성 부족과 신화화 현상을 도전하기 위해 다학제적 방법론 틀을 개발하기 위해.
- 체계적 탐구를 통해 훈련 데이터, 모델 아키텍처, 생성 출력 내 임베디드 편향을 밝혀내는 데 연구자들을 지원하기 위해.
- 기술적 평가를 넘어서 정치적·윤리적 참여를 장려하기 위해.
- 다양한 모델, 특히 투명도 수준이 다른 오픈소스 모델들—Stable Diffusion를 포함해—에도 적용 가능한 영리하고 유연한 툴킷을 제공하기 위해.
제안 방법
- '생태계 해체': 기업 소유, 자금 지원, 조직 목표를 포함한 모델 개발 배경의 상업적·제도적·인센티브 구조를 분석한다.
- '데이터 해체': 텍스트-이미지 쌍으로 구성된 훈련 데이터의 구성, 기원, 편향을 조사하며, 역사적·문화적 불균형이 모델 행동에 어떻게 내재되어 있는지 강조한다.
- '출력 해체': 반복적 프롬프팅, 반성, 인터페이스 기반 실험을 통해 생성된 이미지에서 모델의 논리, 스테레오타입, 미학적 경향을 드러낸다.
- 비판적 AI 연구, 디지털 방법론, 미디어 연구의 방법을 융합하여 AI 이미지 모델의 통합적·사회기술적 분석을 달성한다.
- Stable Diffusion를 대표적인 오픈소스 모델로 삼아 사례 연구 방법론을 적용하여 툴킷의 적용 가능성을 입증한다.
- 다양한 연구 전통을 통합하여 단순화된 기술적 또는 순수 문화적 분석을 피하기 위해 방법론적 다원성과 '해석의 오염'을 강조한다.
실험 결과
연구 질문
- RQ1AI 이미지 모델 개발 둘레의 상업적·제도적 구조는 그들의 설계와 배포에 어떻게 영향을 미치는가?
- RQ2생성형 이미지 모델의 훈련 데이터에 내재된 편향과 표현 패턴은 무엇이며, 역사적 권력 불균형을 어떻게 반영하는가?
- RQ3프롬프팅 전략은 모델의 내재된 논리, 미학적 선호도, 스테레오타입 경향을 이미지 생성 과정에서 어떻게 드러내는가?
- RQ4생성 출력은 시각 문화 내 기존의 성별화, 인종화, 성적화된 스테레오타입을 어떻게 재생산하거나 도전하는가?
- RQ5연구자들이 기술적, 문화적, 정치적 차원을 동시에 고려할 수 있는 비판적이고 다차원적인 AI 이미지 모델 이해를 어떻게 개발할 수 있는가?
주요 결과
- 프롬프트로 '간호사'를 입력했을 때 Stable Diffusion는 주로 백인, 젊고 고전적으로 아름다운 여성 간호사를 생성하며, 출력에 강력한 성별화 및 인종화된 스테레오타입이 내재되어 있음을 드러낸다.
- 프롬프트에 '초현실적', '4K'가 포함될 경우 사진, 디지털 아트, 3D 렌더링을 융합한 하이브리드 미학이 생성되며, 이는 모델 고유의 스타일적 경향성을 시사한다.
- '위협적인 얼굴'이나 '친근한 얼굴'에 대한 프롬프트는 항상 기존 사회적 편향, 즉 인종적·성별적 과장된 표현을 반영하는 이미지를 생성한다.
- 비서류성 정체성은 생성된 이미지에서 더 인간스럽지 않으며, 더 성적화되고 더 스테레오타입화되어 있어 심층적인 표현적 불균형을 드러낸다.
- 반복적 프롬프팅과 반성은 모델이 중립적이거나 객관적인 표현을 생성하는 것이 아니라 기존 문화적 규범을 재생산하고 강화함을 드러낸다.
- 이 툴킷은 AI 이미지 모델이 중립적 도구가 아니라 훈련 데이터와 개발 생태계에 내재된 구조적 불평등을 반영하고 강화한다는 점을 성공적으로 드러냈다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.