[論文レビュー] ArtFusion: Controllable Arbitrary Style Transfer using Dual Conditional Latent Diffusion Models
ArtFusionは、訓練および推論時にコンテンツとスタイルの両方を条件として扱う二重条件付き潜在拡散モデル(Dual-cLDM)を用いた、任意のスタイル転送のための拡散モデルを提案する。この手法により、制御可能で高精細なスタイル転送が可能となり、分類器フリーのガイドランスとコンテンツリファインヤーにより、類似度損失に起因するバイアスを回避し、芸術的細部の保持を実現する。従来のフォワードパス型手法に比べ、スタイル転送の質とユーザーが調整可能なコンテンツ・スタイルのバランスにおいて優れた性能を発揮する。
Arbitrary Style Transfer (AST) aims to transform images by adopting the style from any selected artwork. Nonetheless, the need to accommodate diverse and subjective user preferences poses a significant challenge. While some users wish to preserve distinct content structures, others might favor a more pronounced stylization. Despite advances in feed-forward AST methods, their limited customizability hinders their practical application. We propose a new approach, ArtFusion, which provides a flexible balance between content and style. In contrast to traditional methods reliant on biased similarity losses, ArtFusion utilizes our innovative Dual Conditional Latent Diffusion Probabilistic Models (Dual-cLDM). This approach mitigates repetitive patterns and enhances subtle artistic aspects like brush strokes and genre-specific features. Despite the promising results of conditional diffusion probabilistic models (cDM) in various generative tasks, their introduction to style transfer is challenging due to the requirement for paired training data. ArtFusion successfully navigates this issue, offering more practical and controllable stylization. A key element of our approach involves using a single image for both content and style during model training, all the while maintaining effective stylization during inference. ArtFusion outperforms existing approaches on outstanding controllability and faithful presentation of artistic details, providing evidence of its superior style transfer capabilities. Furthermore, the Dual-cLDM utilized in ArtFusion carries the potential for a variety of complex multi-condition generative tasks, thus greatly broadening the impact of our research.
研究の動機と目的
- フォワードパス型任意スタイル転送(AST)モデルの限界を解消すること。これらは類似度損失に起因するバイアスにより、硬直的で過剰または不十分なスタイル転送結果を生じがちである。
- 実世界の状況では通常入手不可能なため、スタイル転送のための条件付き拡散モデルのトレーニングにペアデータを必要としない問題を克服すること。
- ユーザーの主観的好みに応じて、コンテンツ保持とスタイル強度のバランスを柔軟かつユーザー制御可能に実現すること。
- 繰り返しアーティファクトを引き起こさずに、筆致やジャンル固有の特徴といった微細な芸術的ディテールを保持すること。
- ペアデータが不要で、高価な最適化を伴わない状態で、拡散モデルがASTに効果的に適応可能であることを示すこと。
提案手法
- ArtFusionは、コンテンツとスタイルの両方の特徴を同時に条件として用いる二重条件付き潜在拡散モデル(Dual-cLDM)を採用し、共通の潜在空間内でノイズ除去プロセスを制御する。
- トレーニング段階では、単一の画像をコンテンツとスタイルの両方の参照として用いる自己再構成タスクに基づく尤度学習により最適化され、ペアデータの必要性が排除される。
- コンテンツリファインヤーを導入し、コンテンツ特徴マップの深さを16から12に圧縮することで、残留するスタイル情報の低減と、コンテンツ特徴への過剰な依存の防止を実現する。
- 分類器フリーのガイドランス(CFG)を二次元に拡張(2D-CFG)し、推論段階でコンテンツとスタイルのガイドランススケールを独立して制御可能にすることで、動的なスタイル調整が可能になる。
- スタイル特徴は事前学習済みのVGGネットワークで抽出され、コンテンツ特徴は第1段階のVAEで符号化され、両方の特徴が各ノイズ除去ステップで適応的正規化層を介して注入される。
- 潜在空間におけるノイズ補間により、複数の芸術的スタイル間で滑らかで連続的な遷移が可能となり、ハイブリッドスタイル生成が促進される。

実験結果
リサーチクエスチョン
- RQ1ペアデータが不要な状態で、任意のスタイル転送に効果的に適用可能な条件付き拡散モデルをトレーニングできるか?
- RQ2推論段階で、ユーザーの好みを反映するためにコンテンツとスタイルを制御可能にバランスさせる方法は何か?
- RQ3類似度ベースの損失(例:VGGの平均・分散)に起因するバイアスを回避できるか?これによりアーティファクトや色の歪みが生じるのを防げるか?
- RQ4拡散モデルは、筆致やジャンル固有の特徴といった微細な芸術的ディテールをどの程度保持できるか?
- RQ5二重条件付き潜在拡散フレームワークは、スタイル転送を超えて、他のマルチ条件生成タスクにも一般化可能か?
主な発見
- 定性的および定量的評価により、ArtFusionは従来のフォワードパス型ASTモデルに比べ、筆致やジャンル固有の特徴といった微細な芸術的ディテールの保持において優れた性能を示した。
- モデルは優れたスタイル転送の忠実度を達成し、複雑または抽象的なスタイルリファレンスに対しても、視覚的にリファレンスに近い外観の出力を得られた。
- 2D-CFGの活用により、ガイドランススケールのチューニングによって、ユーザーが不十分なスタイル転送から過剰なスタイル転送まで動的にコンテンツ・スタイルのトレードオフを調整可能となった。
- アブレーションスタディの結果、コンテンツ特徴を16から12次元に圧縮することで最適なバランスが達成され、コンテンツ特徴への過剰な依存とコンテンツ構造の損失の両方を防止できた。
- VGGベースのスタイル類似度損失に依存するモデルに見られるような、繰り返しや色の歪みといった一般的なアーティファクトを回避した。
- 潜在空間における補間により、コンテンツリファレンスとスタイルリファレンスを組み合わせたハイブリッドスタイルを含め、芸術的スタイル間の滑らかで連続的なブレンドが可能となった。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。