[논문 리뷰] Large-scale Text-to-Image Generation Models for Visual Artists' Creative Works
이 연구는 시각 예술가들이 DALL-E와 같은 대규모 텍스트-이미지 생성 모델(LTGMs)을 창작 워크플로우에 어떻게 통합하는지 조사한다. 72篇의 논문에 대한 문헌 고찰과 35개 영역의 28명의 예술가와의 인터뷰를 통해 자동화, 탐색, 매개 역할이라는 세 가지 핵심 역할을 규명하고, 다중 모odal 입력, 프롬프트 엔지니어링 지원, 모델 커스터마이제이션, 조정 가능한 변동성 제어를 포함한 사용성 향상을 위한 네 가지 설계 지침을 제안한다.
Large-scale Text-to-image Generation Models (LTGMs) (e.g., DALL-E), self-supervised deep learning models trained on a huge dataset, have demonstrated the capacity for generating high-quality open-domain images from multi-modal input. Although they can even produce anthropomorphized versions of objects and animals, combine irrelevant concepts in reasonable ways, and give variation to any user-provided images, we witnessed such rapid technological advancement left many visual artists disoriented in leveraging LTGMs more actively in their creative works. Our goal in this work is to understand how visual artists would adopt LTGMs to support their creative works. To this end, we conducted an interview study as well as a systematic literature review of 72 system/application papers for a thorough examination. A total of 28 visual artists covering 35 distinct visual art domains acknowledged LTGMs' versatile roles with high usability to support creative works in automating the creation process (i.e., automation), expanding their ideas (i.e., exploration), and facilitating or arbitrating in communication (i.e., mediation). We conclude by providing four design guidelines that future researchers can refer to in making intelligent user interfaces using LTGMs.
연구 동기 및 목표
- 시각 예술가들이 대규모 텍스트-이미지 생성 모델(LTGMs)을 창작 과정에 어떻게 통합하는지 이해하는 것.
- 예술 워크플로우를 지원하는 데 있어 LTGMs가 맡는 특정 역할, 예를 들어 자동화, 아이디어 확장, 소통 매개 등과 같은 역할을 규명하는 것.
- 프롬프트 엔지니어링, 제어 가능성, 인터페이스 설계의 한계로 인해 LTGMs를 도입하는 데 겪는 과제를 해결하는 것.
- 시각 예술가들을 위한 LTGM 사용성을 향상시키는 데 기여할 수 있는 실질적인 설계 지침을 제공하는 것.
제안 방법
- HCI 분야에서 생성 모델에 관한 72편의 시스템 및 애플리케이션 논문에 대한 체계적 문헌 고찰을 수행하여 사용자, 작업, 역할과 관련된 반복되는 주제를 추출하였다.
- 35개의 다양한 시각 예술 영역에 걸쳐 28명의 시각 예술가와의 반구조화된 인터뷰를 수행하여 실제 적용 패턴과 과제를 탐구하였다.
- 인터뷰 데이터에 대해 문헌 고찰에서 유도된 주제를 바탕으로 추론적 및 유도적 접근 방식을 결합한 이중 코드화 기법을 사용하였다.
- 예술 워크플로우에서 LTGMs의 반복적인 역할을 규명: 반복적인 작업 자동화, 새로운 아이디어 탐색, 소통 매개.
- 실증적 발견을 바탕으로 네 가지 설계 지침을 제안: 변동성 제어, 영역별 모델 커스터마이제이션, 다중 모달 입력 지원, 프롬프트 엔지니어링 지원.
- 예술가들의 사용성, 제어력, 창작 주도성에 대한 피드백을 정성적으로 분석하여 설계 제안의 타당성을 검증하였다.
실험 결과
연구 질문
- RQ1LTGMs를 사용하는 데 가장 수용적인 시각 예술가의 하위군은 누구이며, 그들의 도입에 영향을 주는 요인은 무엇인가?
- RQ2시각 예술가들은 워크플로우에서 LTGMs를 어떤 창작 작업에 사용하는가?
- RQ3LTGMs는 시각 예술가들에게 어떤 역할을 하는가—특히 자동화, 아이디어 생성, 소통 매개 측면에서?
- RQ4LTGMs가 예술 실천에 더 깊이 통합되는 것을 막는 주요 사용성 장벽은 무엇인가?
주요 결과
- 시각 예술가들은 반복적인 창작 작업, 예를 들어 초안이나 변형 생성을 자동화하는 데 LTGMs를 가치 있는 도구로 인식한다.
- LTGMs를 사용해 텍스트 프롬프트에서 예측 불가능하거나 추상적인 시각적 개념을 생성함으로써 창작 아이디어를 확장한다.
- 예술가들은 특히 예술적 의도를 이해하지 못할 수 있는 클라이언트나 협업자와의 소통에서 LTGMs를 매개자로 활용하는 데 가치를 둔다.
- 주요 제한 요소는 프롬프트 엔지니어링의 어려움으로, 많은 예술가들이 텍스트만으로 복잡하거나 추상적인 시각적 아이디어를 표현하는 데 어려움을 겪는다.
- 이미지가 생생하거나 추상적일 경우 예술가들은 다중 모달 입력(예: 스케치, 음성, 제스처)을 통해 자신의 의도를 더 잘 전달할 수 있기를 원한다.
- 현재의 LTGM 인터페이스는 충분한 제어력과 커스터마이제이션 기능이 부족하여 생성된 출력이 예술가의 비전과 일치하지 않을 때 좌절감을 느낀다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.