Skip to main content
QUICK REVIEW

[論文レビュー] Paint4Poem: A Dataset for Artistic Visualization of Classical Chinese Poems

Dan Li, Shuai Wang|arXiv (Cornell University)|Sep 23, 2021
Generative Adversarial Networks and Image Synthesis参考文献 30被引用数 5
ひとこと要約

本論文では、古典的中国詩の芸術的可視化を目的とした新規データセットPaint4Poemを紹介する。このデータセットには、芸術家・豊子斎の作品から手作業で選別された301組の詩・絵画ペアに加え、Webスクリーピングと画像スタイル分類を用いて収集された92,852組の追加ペア(3,648組のキャプション・絵画ペアと89,204組の詩・絵画ペア)が含まれる。ベンチマーク評価の結果、最先端のテキストから画像生成モデル(AttnGANとMirrorGAN)は高品質でスタイル的に正確な絵画を生成できるが、詩の意味的含みを完全に捉えるのは困難であることが示された。

ABSTRACT

In this work we propose a new task: artistic visualization of classical Chinese poems, where the goal is to generatepaintings of a certain artistic style for classical Chinese poems. For this purpose, we construct a new dataset called Paint4Poem. Thefirst part of Paint4Poem consists of 301 high-quality poem-painting pairs collected manually from an influential modern Chinese artistFeng Zikai. As its small scale poses challenges for effectively training poem-to-painting generation models, we introduce the secondpart of Paint4Poem, which consists of 3,648 caption-painting pairs collected manually from Feng Zikai's paintings and 89,204 poem-painting pairs collected automatically from the web. We expect the former to help learning the artist painting style as it containshis most paintings, and the latter to help learning the semantic relevance between poems and paintings. Further, we analyze Paint4Poem regarding poem diversity, painting style, and the semantic relevance between poems and paintings. We create abenchmark for Paint4Poem: we train two representative text-to-image generation models: AttnGAN and MirrorGAN, and evaluate theirperformance regarding painting pictorial quality, painting stylistic relevance, and semantic relevance between poems and paintings.The results indicate that the models are able to generate paintings that have good pictorial quality and mimic Feng Zikai's style, but thereflection of poem semantics is limited. The dataset also poses many interesting research directions on this task, including transferlearning, few-shot learning, text-to-image generation for low-resource data etc. The dataset is publicly available.(https://github.com/paint4poem/paint4poem)

研究の動機と目的

  • 古典的中国詩の芸術的可視化のためのデータセットの不足に取り組むこと。これは文学と視覚芸術を結ぶタスクである。
  • 機械学習モデルが古典的中国詩の意味的内容を反映する、特定の芸術的スタイル(豊子斎のスタイル)の絵画を生成できるようにすること。
  • 文化的に豊かな低リソースデータセットを提供することで、低リソースのテキストから画像生成、少数の例学習、トランスファー学習に関する研究を支援すること。
  • 生成された絵画の絵画的品質、スタイル的関連性、および意味的整合性を評価するためのベンチマークを構築すること。

提案手法

  • 二段階構成のデータセットを構築する:豊子斎詩(豊子斎の作品から高品質な詩・絵画ペア301組を訓練およびテストに使用)。
  • 豊子斎の絵画から手作業で3,648組のキャプション・絵画ペアを収集し、彼の独自な芸術的スタイルを学習する。
  • スクリプトによるWebスクレイピングと画像スタイル分類モデルを用いて、自動的に89,204組の詩・絵画ペアを収集し、詩が中国伝統画のスタイルと整合するようにする。
  • このデータセットを用いて、最先端のテキストから画像生成モデル(AttnGANとMirrorGAN)を訓練および評価する。
  • モデルの性能を3つの次元で評価する:絵画的品質、豊子斎のスタイルとの関連性、入力された詩と生成された画像との意味的整合性。
  • 詩の解説や画像のキャプションといったメタデータを活用し、意味的理解を向上させ、言語と視覚のギャップを埋める。

実験結果

リサーチクエスチョン

  • RQ1テキストから画像生成モデルは、古典的中国詩から豊子斎の芸術的スタイルの絵画を効果的に学習して生成できるか?
  • RQ2生成された絵画に対して、モデルは古典的中国詩の意味的内容をどの程度正確に捉えられるか?
  • RQ3手作業で選別されたキャプション・絵画ペアの導入は、完全に自動化されたデータ収集と比較して、スタイル学習にどの程度寄与するか?
  • RQ4現在のテキストから画像生成モデルは、低リソースで文化的に特異な詩的テキストに対して、意味的に整合した絵画を生成する際にどのような限界を示すか?
  • RQ5トランスファー学習や少数の例学習戦略は、この低リソースで意味的に豊かなタスクにおいて性能を向上させられるか?

主な発見

  • AttnGANおよびMirrorGANモデルは、高品質で豊子斎の作品に類似したスタイルの絵画を効果的に生成できた。
  • 優れた視覚的・スタイル的類似性にもかかわらず、モデルは入力された古典的中国詩の意味的内容を生成された画像に十分に反映する能力に欠けている。
  • 手作業でアノテートされた3,648組のキャプション・絵画ペアの導入により、モデルが豊子斎の独自な芸術的スタイルを学習する能力が著しく向上した。
  • 自動収集された89,204組の詩・絵画ペアは規模が大きくても、Webスクリーピングによるノイズや不整合のため、意味的整合性の面では効果が劣っている。
  • Paint4Poemデータセットは、低リソースで文化的に特異なテキストから画像生成タスクにおける少々の例学習、トランスファー学習、ゼロショット生成に関する新しい研究分野を可能にする。
  • 詩の解説や画像キャプションを含むデータセットのメタデータは、テキストから画像生成における意味的接地の向上に貴重な信号を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。