[論文レビュー] Splicing ViT Features for Semantic Appearance Transfer
この論文では、1組の画像のみを用いて、ソース画像の構造にターゲット画像の視覚的外観をスプライシングすることで高解像度画像を生成する、新しい意味的外観転送手法Spliceを提案する。本手法は、事前学習済みのDINO-ViTモデルを外部的意味的事前分布として活用し、[CLS]トークンによる外観抽出と、深層特徴における自己注意キー類似度による構造抽出を実現することで、敵対的学習を不要とし、セグメンテーションも不要な高精度で、レイアウトを強く保持する生成を可能にする。
We present a method for semantically transferring the visual appearance of one natural image to another. Specifically, our goal is to generate an image in which objects in a source structure image are "painted" with the visual appearance of their semantically related objects in a target appearance image. Our method works by training a generator given only a single structure/appearance image pair as input. To integrate semantic information into our framework - a pivotal component in tackling this task - our key idea is to leverage a pre-trained and fixed Vision Transformer (ViT) model which serves as an external semantic prior. Specifically, we derive novel representations of structure and appearance extracted from deep ViT features, untwisting them from the learned self-attention modules. We then establish an objective function that splices the desired structure and appearance representations, interweaving them together in the space of ViT features. Our framework, which we term "Splice", does not involve adversarial training, nor does it require any additional input information such as semantic segmentation or correspondences, and can generate high-resolution results, e.g., work in HD. We demonstrate high quality results on a variety of in-the-wild image pairs, under significant variations in the number of objects, their pose and appearance.
研究の動機と目的
- ユーザーのガイダンス、セグメンテーション、対応関係を一切必要とせずに、2枚の自然画像間での意味的外観転送を可能にすること。
- ポーズ、形状、外観の変化が著しいオブジェクト間での視覚的外観の転送という課題に対処すること。
- ソース画像の構造的レイアウトを保持しつつ、ターゲットの視覚的外観を意味的に意味のある方法で転送する手法を開発すること。
- 事前学習済みのビジョントランスフォーマー(DINO-ViT)を生成的画像合成のための外部的意味的事前分布として用いる有効性を示すこと。
- 大規模なペairedデータセットを必要とせず、1組の画像のみで高解像度(HD)の生成を実現すること。
提案手法
- 事前学習済みで固定されたDINO-ViTモデルを用いて、外部的意味的事前分布としての深層特徴を抽出する。
- 外観は、最終層のViTにおける[CLS]トークンによって表現され、グローバルな視覚的および意味的コンテンツを捉える。
- 構造は、同じViT層からのキーの自己類似度を介してモデル化され、空間的関係性とオブジェクトレイアウトを符号化する。
- 生成器は、ViT特徴空間において望ましい構造と外観の表現をスプライシングする多成分損失関数を用いて学習される。
- 損失関数には、外観損失([CLS]トークンの一致)、構造損失(キーの自己類似度の一致)、および細部の保持を目的としたアイデンティティ損失が含まれる。
- フレームワークは敵対的学習を回避し、セグメンテーションマップや対応関係、1組の画像ペア以外の追加データも不要である。

実験結果
リサーチクエスチョン
- RQ1事前学習済みビジョントランスフォーマーが、追加の教師信号なしに意味的外観転送のための効果的外部意味的事前分布として機能できるか。
- RQ2ビジョントランスフォーマーの特徴空間において、構造と外観をどのように分離・再結合することで高精細な画像生成が達成できるか。
- RQ3敵対的学習を不要とし、1組の画像のみで高解像度(HD)画像生成が可能か。
- RQ4ViT特徴は、多様なオブジェクトカテゴリーやポーズ間で外観転送時に意味的レイアウトをどの程度保持できるか。
- RQ5非現実的またはドメイン外の画像のような分布シフトの条件下で、本手法はどの程度の性能を示すか。
主な発見
- Spliceは、GANベース、スタイル転送、意味的注意を用いた手法を上回る評価を得ており、Wild-Pairsでは83.1%の支持率、意味的レイアウト保持では95%のIoUを達成した。
- マウンテンズデータセットでは、平均IoUが0.95±0.10を記録し、SAやSTROTSSを上回り、WCT 2に匹敵する高いレイアウト忠実度を実現した。
- アブレーションスタディの結果、外観損失を除去すると外観転送に失敗し、構造損失を除去すると顕著な構造的歪みが生じることが判明した。
- アイデンティティ損失により、明示的な教師信号がなくてもアボカドやナシのテクスチャなどの細部の再現が向上した。
- DINO-ViTの表現が意味的関連性を捉えられない場合、例えばネコの指輪や鳥を飛行機にマッピングするような状況では、本手法は失敗する。
- 特徴の逆再構成解析により、[CLS]トークンが豊富な外観およびオブジェクト部品の情報を符号化していることが確認され、ViT特徴は意味的粒度を保った高解像度画像再構成を可能にすることが分かった。
![Figure 3: Inverting the [CLS] token across layers. Each input image (a) is fed to DINO-ViT to compute its global [CLS] token at different layers. (b) Inversion results: starting from a noise image, we optimize for an image that would match the original [CLS] token at a specific layer. While earlier](https://ar5iv.labs.arxiv.org/html/2201.00424/assets/x3.png)
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。