Skip to main content
QUICK REVIEW

[論文レビュー] Language-Driven Image Style Transfer

Tsu-Jui Fu, Xin Wang|arXiv (Cornell University)|Jun 1, 2021
Generative Adversarial Networks and Image Synthesis参考文献 95被引用数 7
ひとこと要約

本稿では、自然言語の記述から視覚的意味を学習することで、テキスト誘導型の画像スタイル変換を可能にする新規タスクである言語駆動型アートスタイル転送(LDAST)を紹介する。提案された対照的言語視覚アーティスト(CLVA)モデルは、ピクセル単位のスタイル識別器と対照的推論を用い、言語指示とスタイルパターンを一致させる。この手法は、DTD2およびArtEmisデータセットにおいて、自動評価指標と人的評価の両面で最先端の結果を達成した。

ABSTRACT

Despite having promising results, style transfer, which requires preparing style images in advance, may result in lack of creativity and accessibility. Following human instruction, on the other hand, is the most natural way to perform artistic style transfer that can significantly improve controllability for visual effect applications. We introduce a new task, language-driven artistic style transfer (LDAST), to manipulate the style of a content image, guided by a text. We propose contrastive language visual artist (CLVA) that learns to extract visual semantics from style instructions and accomplish LDAST by the patch-wise style discriminator. The discriminator considers the correlation between language and patches of style images or transferred results to jointly embed style instructions. CLVA further compares contrastive pairs of content images and style instructions to improve the mutual relativeness. The results from the same content image can preserve consistent content structures. Besides, they should present analogous style patterns from style instructions that contain similar visual semantics. The experiments show that our CLVA is effective and achieves superb transferred results on LDAST.

研究の動機と目的

  • 従来のスタイル転送には事前に定義されたスタイル画像が必要であり、柔軟性と創造性に欠けるという限界を解消すること。
  • 自然言語の指示を入力として受け入れることで、アートスタイル転送の制御性とアクセシビリティを向上させること。
  • 視覚的スタイルの言語的記述と、それらの正確な視覚的実現との間のギャップを埋めること。
  • テキストで記述された複雑で意味的に豊かなスタイルを、コンテンツ構造を保持したまま転送する方法を開発すること。
  • 視覚的属性や感情的効果を含む多様なスタイル指示に対して、広範な適用性を有するようにモデルを評価すること。

提案手法

  • CLVAは、コンテンツ構造を保持し、スタイル指示からの視覚的意味を抽出する言語視覚アーティスト(LVA)モジュールを採用する。
  • ピクセル単位のスタイル識別器を用い、言語と画像ピクセルを同時に埋め込むことで、細粒度のスタイル一致を実現する。
  • 対照的推論(CR)は、ペアのコンテンツ画像とスタイル指示を比較し、コンテンツ構造の一貫性と、意味的に関連する指示に対して類似したスタイルパターンを強制する。
  • モデルは、コンテンツとスタイル表現の間の相互関連性を最大化するように、対照的損失を用いてエンドツーエンドで訓練される。
  • CLIPベースの視覚言語一致を活用することで、未学習のスタイル記述へのゼロショット一般化性能が向上する。
  • 本手法は、明示的な視覚的属性(例:'水彩'、'スケッチ')と抽象的な感情的効果(例:'穏やか'、'満足')の両方を、スタイル指示としてサポートする。

実験結果

リサーチクエスチョン

  • RQ1事前に定義されたスタイル画像を必要とせず、自然言語の記述を効果的に用いてアートスタイル転送を誘導できるか。
  • RQ2視覚的属性から感情的効果に至るまで多様な言語的記述—意味的に豊かな記述—を、対応する視覚的スタイルパターンに正確にマッピングできるか。
  • RQ3対照的学習が、多様な言語入力に対してスタイル転送の一貫性と品質をどの程度向上させるか。
  • RQ4CLVAは、リtrievalベースのベースラインや既存のGANベースのスタイル転送手法と比較して、スタイル忠実度とコンテンツ保持性において優れているか。
  • RQ5特に抽象的またはマルチコンセプトの記述(例:'穏やか'、'水彩スケッチ')を含む、訓練時に見なかったスタイル指示に対しても、モデルは一般化できるか。

主な発見

  • CLVAは、視覚的属性の指示を用いたDTD2データセットで、SSIM(36.65)とVLS(24.00)の最高スコアを達成し、すべてのベースラインを上回った。
  • CarおよびChurchデータセットでは、CLVAがVLSスコア23.68を達成し、リtrievalベースラインおよびSANetやLSTといった既存手法を上回った。
  • 人的評価では、CLVAが生成した結果が、スタイル指示および半教師ありの真値と、ベースラインと比較してより強い相関を示した。
  • 同じコンテンツ入力からの複数の画像において、CLVAはコンテンツ構造を一貫して保持しており、スタイリングの一貫性を示した。
  • リtrieval手法がより高いSSIMを示すにもかかわらず、CLVAはCLIPベースのリtrievalベースライン(VLS 24.00 対 23.68)を上回り、より優れた指示一致を達成した。
  • 抽象的およびマルチコンセプトのスタイル記述(例:'穏やか'、'水彩スケッチ')に対しても、CLVAは一貫性があり意味的に関連するスタイリングを効果的に生成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。