Skip to main content
QUICK REVIEW

[論文レビュー] Multiresolution Textual Inversion

Giannis Daras, Alexandros G. Dimakis|arXiv (Cornell University)|Nov 30, 2022
Natural Language Processing Techniques被引用数 7
ひとこと要約

本稿では、拡散時間に条件付けたことで、さまざまな解像度の詳細度を表す複数の擬似語を学習できるように、Textual Inversionを拡張するMultiresolution Textual Inversionを提案する。これにより、自然言語プロンプトを用いて制御された画像生成が可能となり、たとえば『$S^{*}(0.8)$』で低解像度、『$S^{*}(0.0)$』で高解像度の出力を得られる。

ABSTRACT

We extend Textual Inversion to learn pseudo-words that represent a concept at different resolutions. This allows us to generate images that use the concept with different levels of detail and also to manipulate different resolutions using language. Once learned, the user can generate images at different levels of agreement to the original concept; "A photo of $S^*(0)$" produces the exact object while the prompt "A photo of $S^*(0.8)$" only matches the rough outlines and colors. Our framework allows us to generate images that use different resolutions of an image (e.g. details, textures, styles) as separate pseudo-words that can be composed in various ways. We open-soure our code in the following URL: https://github.com/giannisdaras/multires_textual_inversion

研究の動機と目的

  • 異なる解像度で同一の概念を表す複数の擬似語を学習するように、Textual Inversionを拡張すること。
  • 自然言語プロンプトを用いて、生成画像の詳細度を制御できるようにすること。
  • 標準的なTextual Inversionで使用される固定埋め込みから、画像生成の解像度を分離すること。
  • 異なる概念におけるさまざまな解像度のコンponentsを柔軟に組み合わせて、クリエイティブな画像合成を可能にすること。
  • 事前学習済みのテキストから画像への拡散モデルおよびDreamBoothなどの既存手法と互換性を維持すること。

提案手法

  • 拡散時間$t$に条件付けたテキスト埋め込みを用い、$\mathrm{emb}_{\lfloor t/T \rfloor}$で入力概念の異なる解像度レベルを表現する。
  • 拡散ステップに依存するノイズ除去目的関数を最適化することで、$\mathrm{Emb}^{*} = \{\mathrm{emb}_0, \dots, \mathrm{emb}_{T-1}\}$の集合を学習する。
  • 固定解像度、半解像度依存、完全解像度依存の3つのサンプリング戦略を用い、生成時に解像度の適用方法を制御する。
  • 線形補間を用いて学習済み埋め込みの間を連続的に補間することで、解像度の連続的制御を可能にする。
  • 条件付けネットワークを$c_\theta(y) = \mathrm{enc}_\theta(\mathrm{emb}_\theta(y))$として分解し、時間依存の解像度インデックスをサポートするように埋め込み層を変更する。
  • 標準的な拡散目的関数を用いて学習する:$\min_{\mathrm{emb}} \mathbb{E}_{t,x,z_t} \left|\left| \hat{\epsilon}_\theta(z_t(x), t, \mathrm{enc}_\theta(\mathrm{emb}_{\lfloor t/T \rfloor})) - \epsilon(z_0, z_t) \right|\right|^2$。

実験結果

リサーチクエスチョン

  • RQ11つの概念に対して、異なる詳細度を表す複数の擬似語を学習できるか?
  • RQ2異なる解像度固有の埋め込みを選択することで、言語プロンプトが生成画像の解像度を制御できるか?
  • RQ3提案手法は、さまざまな解像度レベルで高い画像品質と意味的整合性を維持できるか?
  • RQ4学習済みの解像度固有埋め込みを、異なる概念やプロンプト間で組み合わせて使用できるか?
  • RQ5生成品質と柔軟性の観点から、標準的なTextual Inversionと比較して、Multiresolution Textual Inversionは優れているか?

主な発見

  • 本手法は、1つの概念に対して複数の解像度固有の埋め込みを成功裏に学習し、言語による画像の詳細度制御を可能にした。
  • 固定解像度サンプリングでは、$S^{*}|0.0|$を用いることで、入力画像のボタンなど細部の抽出が可能になった。
  • 半解像度依存サンプリングでは、高ノイズレベルで高レベルのバリエーションが可能で、たとえば$S^{*}(0.8)$は入力の色やポーズに概ね一致するが、写真のようにリアルな画像を生成した。
  • 完全解像度依存サンプリングでは、すべての拡散ステップで入力概念と強い一致を保ち、構造的一致性が維持された。
  • 本手法は、異なる概念間で解像度コンponentsを任意に組み合わせられ、たとえばプラスチック製品の詳細構造を用いて、新しい形状の犬や猫を生成できる。
  • 定性的な比較により、Multiresolution Textual Inversionは、標準的なTextual Inversionと同等またはそれ以上の性能を示し、パーソナライズド画像生成タスクで優れた結果を達成した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。