Skip to main content
QUICK REVIEW

[論文レビュー] Generative Art Using Neural Visual Grammars and Dual Encoders

Chrisantha Fernando, S. M. Ali Eslami|arXiv (Cornell University)|May 1, 2021
Generative Adversarial Networks and Image Synthesis参考文献 24被引用数 9
ひとこと要約

本論文では、階層的ニューラルビジョナルグラマーとマルチモーダルなデュアルエンコーダーを用いて、テキストプロンプトから画像を生成する画期的なジェネレーティブアートシステムを提示する。微分可能グラマーを介して画像を進化させ、視覚言語対照学習モデルによって評価することで、多様で美的に多様な解釈を生み出す。例えば「ジャングル・イン・ザ・タイガー」に対して1950年代のパルプ映画風のスタイルを生成するなど、アルゴリズム的進化と学習された意味的整合性を通じて、創発的な芸術的創造性を示している。

ABSTRACT

Whilst there are perhaps only a few scientific methods, there seem to be almost as many artistic methods as there are artists. Artistic processes appear to inhabit the highest order of open-endedness. To begin to understand some of the processes of art making it is helpful to try to automate them even partially. In this paper, a novel algorithm for producing generative art is described which allows a user to input a text string, and which in a creative response to this string, outputs an image which interprets that string. It does so by evolving images using a hierarchical neural Lindenmeyer system, and evaluating these images along the way using an image text dual encoder trained on billions of images and their associated text from the internet. In doing so we have access to and control over an instance of an artistic process, allowing analysis of which aspects of the artistic process become the task of the algorithm, and which elements remain the responsibility of the artist.

研究の動機と目的

  • 自然言語プロンプトから芸術的画像を生成する、アルゴリズム的かつオープンエンドなプロセスを開発すること。
  • 人工的システムが芸術的創造の側面、特に形式的生成と人間の評価の間の相互作用をどのように模倣できるかを調査すること。
  • 学習されたビジョナル・ランゲージモデルがジェネレーティブアートパイプラインにおける信頼できる、バイアスのないレビュアーとして機能できるかを検証すること。
  • アルゴリズム的創造性の限界を、人間の期待とは乖離した新たな視覚的解釈が出現する様子を観察することで理解すること。
  • アルゴリズムが視覚的構成を担当する一方で、人間の判断がキュレーションと最終選定において中心的役割を果たすフレームワークを構築すること。

提案手法

  • 階層的ニューラルリンデンマイヤー系(ビジョナルグラマー)が、再帰的書き換え規則を用いて構造的で構成的な画像生成を実現する。
  • 微分可能進化を用いて画像空間を探索し、視覚言語デュアルエンコーダーから得られる学習済み報酬信号によってガイドする。
  • デュアルエンコーダーは、インターネットから得た数十億の画像・テキストペアで事前学習されており、対照学習により視覚的・言語的表現の整合性を学習する。
  • 画像候補は、入力プロンプトとの意味的類似度に基づいてスコア付けされ、スコアが高いほど意味的整合性が高くなる。
  • 進化はグラマーのパラメータに関する確率的探索を経て行われ、デュアルエンコーダーのスコアに基づく選択により、多様性と関連性が促進される。
  • 最終出力は人間によるキュレーションによって選別され、アルゴリズム的生成にもかかわらず、人間の判断が芸術的評価において不可欠であることが強調される。

実験結果

リサーチクエスチョン

  • RQ1学習済みビジョナル・ランゲージモデルと組み合わせたニューラルビジョナルグラマーは、自然言語プロンプトから意味的に根拠のある多様な画像を生成できるか?
  • RQ2学習済みデュアルエンコーダーは、ジェネレーティブアートパイプラインにおいて信頼的でバイアスのないレビュアーとして十分に機能できるか?
  • RQ3アルゴリズム的生成プロセスと人間によるキュレーションは、最終的な芸術的出力にどのように作用し合うか?
  • RQ4直接的な監視がなく、意味的整合性のみに依存する場合に、どのような創発的視覚的解釈が生じるか?
  • RQ5「ジャングル・イン・ザ・タイガー」を「タイガー・イン・ザ・ジャングル」と逆転させ、予期しない美的効果をもたらすような解釈を、システムが意味的に有意義に生成できるか?

主な発見

  • 本システムは、「ジャングル・イン・ザ・タイガー」というプロンプトに対して、1950年代のパルプ映画風のポスターを成功裏に生成し、元のフレーズから直接導出されない明確な美術的解釈を示した。
  • 16回の独立した進化実験において、同じプロンプトに対しても多様な出力が得られ、プロンプトに対する耐障害性と変動性の両方を示した。
  • デュアルエンコーダーは画像とテキストの整合性を効果的に評価し、明示的な監視なしに意味的に関連する視覚的構成を優先できるようにした。
  • 生成された画像はしばしば驚きを伴い、直感的でないものであった。例えば「ジャングル・イン・ザ・タイガー」を、現実的描写ではなく、シュルレアリスム的で映画的な風景として解釈した。
  • 著者らは、モデルの解釈がインターネットデータの学習履歴に影響を受けており、直接的な参照がなくても、ヘンリー・ルソーに類似したスタイル的影響が現れることを観察した。
  • 人間によるキュレーションは不可欠であり、著者らはしばしば出力を拒否し、自身の評価基準を時間とともに見直すことがあり、芸術的評価における人間判断の代替不可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。