[논문 리뷰] No Longer Trending on Artstation: Prompt Analysis of Generative AI Art
이 연구는 2022–2023년 동안 스테이블 디퓨전과 미드저니에서 유저가 생성한 300만 건이 넘는 텍스트-이미지 프롬프트를 자연어 처리(NLP), 토픽 모델링, 시각화 기법을 활용해 분석하여 생성형 AI가 시각적 문화에 어떻게 영향을 미치는지 조사한다. 연구 결과, 프롬프팅은 표면적인 미학과 대중적인 스타일—특히 판타지, 애니메이션, 젊은 여성의 초현실적인 묘사—을 우선시하며 문화적 규범과 미학적 동질성을 강화하고 있으며, 대부분의 사용자는 예술적 목적보다는 여가적 목적에서 사용하고 있음을 확인했다.
Image generation using generative AI is rapidly becoming a major new source of visual media, with billions of AI generated images created using diffusion models such as Stable Diffusion and Midjourney over the last few years. In this paper we collect and analyse over 3 million prompts and the images they generate. Using natural language processing, topic analysis and visualisation methods we aim to understand collectively how people are using text prompts, the impact of these systems on artists, and more broadly on the visual cultures they promote. Our study shows that prompting focuses largely on surface aesthetics, reinforcing cultural norms, popular conventional representations and imagery. We also find that many users focus on popular topics (such as making colouring books, fantasy art, or Christmas cards), suggesting that the dominant use for the systems analysed is recreational rather than artistic.
연구 동기 및 목표
- 사용자들이 생성형 AI 이미지 시스템에서 텍스트 프롬프트를 통해 어떻게 공동으로 시각적 문화를 형성하는지 이해하기 위해.
- 미드저니와 스테이블 디퓨전과 같은 텍스트-이미지(TTI) 모델의 광범위한 도입이 초래하는 문화적, 미학적, 윤리적 영향을 조사하기 위해.
- 생성형 AI가 예술적 혁신을 촉진하는지, 아니면 기존의 시각적 스테레오타입과 스타일 기준을 강화하는지 평가하기 위해.
- TTI 시스템이 인간 예술가와 광범위한 시각 예술 생태계에 어떤 영향을 미치는지 분석하기 위해.
- 프롬프트 언어와 이미지 출력이 어떻게 지배적인 문화적 및 미학적 관례를 반영하고 재생산하는지 탐구하기 위해.
제안 방법
- 2022년과 2023년 동안 미드저니와 스테이블 디퓨전에서 수집한 300만 건이 넘는 프롬프트와 해당 이미지를 수집 및 분석하였다.
- 자연어 처리(NLP) 기법을 적용하였으며, 토픽 모델링에는 BERTopic, 텍스트 임bedding의 차원 축소에는 UMAP를 사용하였다.
- cTF-IDF 가중치와 HDBSCAN 클러스터링을 활용해 프롬프트 및 이미지 설명 내 주요 주제와 스타일적 선호도를 식별하고 분류하였다.
- 사람, 물체, 환경을 중심으로 반복되는 주제, 구성, 스타일적 특징을 식별하기 위해 이미지 출력에 대한 시각적 분석을 수행하였다.
- 시간에 따른 프롬프트 길이, 복잡도, 주제 빈도를 비교하여 사용자 행동의 변화와 시스템 접근성 향상을 평가하였다.
- 통계적 패턴의 질적 해석을 통해 AI 생성 이미지의 문화적 및 미학적 함의를 평가하였다.
실험 결과
연구 질문
- RQ1텍스트-이미지 모델에서 사용자 프롬프트는 지배적인 문화적 및 미학적 기준을 어떻게 반영하고 강화하는가?
- RQ2생성형 AI 시스템은 시각적 출력에서 얼마나 심각한 스타일적 동질화와 반복을 초래하는가?
- RQ3AI 생성 이미지에서 지배적인 주제, 대상, 예술 스타일은 무엇이며, 2022년에서 2023년 사이에 어떻게 변화해 왔는가?
- RQ4프롬프트 및 이미지 분석을 바탕으로 TTI 시스템의 여가적 사용과 예술적 사용 방식은 어떻게 다를까?
- RQ5AI 생성 이미지는 훈련 데이터와 사용자 행동에 존재하는 인종, 성별, 문화적 편향을 어떻게 반영하거나 재생산하는가?
주요 결과
- 가장 흔한 이미지 주제는 여성(22.26%), 남성(16.2%), 드레스(6.92%), 머리카락(5.51%), 방(5.44%), 꽃(5.33%)이었으며, 이는 인간 인물과 개인적 미학에 대한 강한 집중을 시사한다.
- 미드저니 사용자들은 2022년에서 2023년 사이에 점점 더 짧은 프롬프트를 선호함으로써 접근성 향상과 전문가 수준의 프롬프팅 필요성 감소를 보였다.
- 이미지 생성에서 가장 인기 있는 주제는 판타지 아트, 게임 아트, 애니메이션 일러스트, 젊은 여성의 묘사였으며, '시네마틱 라이팅'과 '초세밀'이 가장 높은 스타일 기술어로 사용되었다.
- 프롬프트와 이미지의 상당 부분이 특히 2023년 후반에 접어들면서 색칠하기 북과 크리스마스 테마 아트와 같은 여가적 용도와 관련이 있었다.
- 생성된 이미지의 총량이 막대함에도 불구하고, 인간이 만든 예술처럼 미학적으로 독창적이거나 기억에 남는 경우가 극히 소수에 그쳐, 예술적 혁신이 제한되어 있음을 시사한다.
- 본 연구는 현재의 생성형 AI가 인간 예술에 심각한 위협이 되지 않으며, 기존의 인기 스타일을 모방할 뿐 원형적 예술적 창의성이나 인간의 의도성을 지닌 바 없이 단순히 반복하고 있음을 결론 내린다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.