[논문 리뷰] Generative Art Using Neural Visual Grammars and Dual Encoders
이 논문은 계층적 신경 시각 문법과 다중모달 이중 인코더를 사용하여 텍스트 프롬프트에서 이미지를 생성하는 혁신적인 생성 예술 시스템을 제시한다. 기하학적 문법을 통해 이미지를 기하학적으로 진화시키고, 시각-언어 대비 학습 모델을 통해 평가함으로써, 다양한 미학적 해석을 생성한다. 예를 들어, 'Tiger in the Jungle'에 대해 1950년대 펄프 시네마 스타일의 해석을 만들어내며, 알고리즘적 진화와 학습된 의미적 일치를 통해 탄생한 잠재적 예술 창작 능력을 입증한다.
Whilst there are perhaps only a few scientific methods, there seem to be almost as many artistic methods as there are artists. Artistic processes appear to inhabit the highest order of open-endedness. To begin to understand some of the processes of art making it is helpful to try to automate them even partially. In this paper, a novel algorithm for producing generative art is described which allows a user to input a text string, and which in a creative response to this string, outputs an image which interprets that string. It does so by evolving images using a hierarchical neural Lindenmeyer system, and evaluating these images along the way using an image text dual encoder trained on billions of images and their associated text from the internet. In doing so we have access to and control over an instance of an artistic process, allowing analysis of which aspects of the artistic process become the task of the algorithm, and which elements remain the responsibility of the artist.
연구 동기 및 목표
- 자연어 프롬프트에서 알고리즘적이고 개방적인 과정을 통해 예술적 이미지를 생성할 수 있는 시스템을 개발하는 것.
- 인공 시스템이 예술 창작의 일부를 모방할 수 있는 방식, 특히 형식적 생성과 인간 평가 간의 상호작용을 탐구하는 것.
- 학습된 시각-언어 모델이 생성 예술 파이프라인에서 신뢰할 수 있고 편향이 없는 평론가로 기능할 수 있는지 조사하는 것.
- 인간의 기대와 다를 수 있는 시각적 해석이 어떻게 탄생하는지 관찰함으로써 알고리즘적 창의성의 한계를 이해하는 것.
- 알고리즘이 시각적 구성은 담당하고 인간의 판단은 최종 선정과 큐레이션에서 중심적인 역할을 하는 프레임워크를 구축하는 것.
제안 방법
- 계층적 신경 리덴마이어 시스템(시각 문법)이 재귀적 재작성 규칙을 통해 구조적이고 구성적인 이미지 생성을 가능하게 한다.
- 학습된 보상 신호에 의해 유도되는 기하학적 문법을 통해 이미지 공간을 탐색하는 미분 가능 진화를 사용한다.
- 이중 인코더는 인터넷에서 수집한 수십억 개의 이미지-텍스트 쌍을 사전 학습하여, 대비 학습을 통해 시각적 표현과 언어적 표현 간의 일치를 학습한다.
- 이미지 후보는 입력 텍스트 프롬프트와의 의미적 유사도 기반으로 평가되며, 높은 점수는 더 나은 의미 일치를 의미한다.
- 진화는 문법 파rameter에 대한 확률적 탐색을 통해 진행되며, 이중 인코더 점수에 기반한 선택을 통해 다양성과 관련성 모두를 증진시킨다.
- 최종 출력은 인간 큐레이션을 통해 선별되며, 이는 알고리즘적 생성에도 불구하고 인간 판단이 예술 평가에서 핵심적인 역할을 한다는 점을 강조한다.
실험 결과
연구 질문
- RQ1학습된 시각-언어 모델과 결합된 신경 시각 문법이 자연어 프롬프트에서 의미적으로 기반된 다양한 이미지를 생성할 수 있는가?
- RQ2학습된 이중 인코더가 생성 예술 파이프라인에서 신뢰할 수 있고 편향이 없는 평론가로 기능할 수 있는 정도는 어느 정도인가?
- RQ3알고리즘적 생성 과정과 인간 큐레이션은 최종 예술적 출력을 어떻게 함께 형성하는가?
- RQ4직접적인 감독 없이 오직 의미 일치에 의해 제약을 받는 시스템에서 어떤 종류의 잠재적 시각적 해석이 탄생하는가?
- RQ5예를 들어, 'Tiger in the Jungle'을 'Jungle in the Tiger'로 변형하면서 놀라운 예술적 결과를 낳는 해석을 생성할 수 있는가?
주요 결과
- 시스템은 'Jungle in the Tiger' 프롬프트에 대해 1950년대 펄프 시네마 스타일의 포스터를 성공적으로 생성하여, 원래 문장에서 직접 유도되지 않은 독특한 미학적 해석을 보여주었다.
- 동일한 프롬프트에 대해 16회의 독립적인 진화 실행 동안 다양한 출력을 생성하여, 시스템의 강건성과 변동성을 입증하였다.
- 이중 인코더는 이미지-텍스트 일치를 효과적으로 평가하여, 명시적 지시 없이도 의미적으로 관련된 시각적 구성에 중점을 둔 시스템을 가능하게 하였다.
- 생성된 이미지는 종종 놀라움을 주며 명백하지 않은 해석을 보였는데, 예를 들어 'Jungle in the Tiger'를 사실적인 묘사가 아닌 초현실적인 영화적 장면으로 해석하였다.
- 저자들은 모델의 해석이 인터넷 데이터에 기반한 훈련으로 인해 스타일적 영향을 받았음을 관찰하였으며, 예를 들어 헨리 루소의 스타일을 떠올리게 하는 요소들이 직접적인 참조 없이도 나타났다.
- 인간 큐레이션은 여전히 필수적이었으며, 저자들은 종종 출력을 기각하고 자신의 평가 기준을 시간이 지남에 따라 수정하였다. 이는 인간 판단이 예술 평가에서 대체할 수 없는 역할을 한다는 점을 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.