Skip to main content
QUICK REVIEW

[論文レビュー] DiffColor: Toward High Fidelity Text-Guided Image Colorization with Diffusion Models

Jianxin Lin, Peng Xiao|arXiv (Cornell University)|Aug 3, 2023
Generative Adversarial Networks and Image SynthesisComputer Science被引用数 3
ひとこと要約

DiffColorは、事前学習済みのテキストto画像モデルとCLIPベースの対照的損失を活用し、追加の入力が不要な高精細で文脈に整合した色付けを実現する2段階の拡散モデルフレームワークを提案する。この手法により、文脈内での色付けとオブジェクトレベルの制御が可能となり、視覚的品質、色の正確性、多様性の面で先行手法を上回る。

ABSTRACT

Recent data-driven image colorization methods have enabled automatic or reference-based colorization, while still suffering from unsatisfactory and inaccurate object-level color control. To address these issues, we propose a new method called DiffColor that leverages the power of pre-trained diffusion models to recover vivid colors conditioned on a prompt text, without any additional inputs. DiffColor mainly contains two stages: colorization with generative color prior and in-context controllable colorization. Specifically, we first fine-tune a pre-trained text-to-image model to generate colorized images using a CLIP-based contrastive loss. Then we try to obtain an optimized text embedding aligning the colorized image and the text prompt, and a fine-tuned diffusion model enabling high-quality image reconstruction. Our method can produce vivid and diverse colors with a few iterations, and keep the structure and background intact while having colors well-aligned with the target language guidance. Moreover, our method allows for in-context colorization, i.e., producing different colorization results by modifying prompt texts without any fine-tuning, and can achieve object-level controllable colorization results. Extensive experiments and user studies demonstrate that DiffColor outperforms previous works in terms of visual quality, color fidelity, and diversity of colorization options.

研究の動機と目的

  • 従来の手法やリファレンスベースの画像色付けには、色がぼやけたり不一致になったり、曖昧になったりするという限界があるため、それらを是正すること。
  • ユーザーがスクラッチやリファレンス画像を提供しなくても、自然言語プロンプトのみで正確で多様かつ鮮やかな色付けを実現すること。
  • 再訓練や微調整なしに、プロンプトの変更のみで異なる色の結果を生成する文脈内色付けを実現すること。
  • 特定の画像領域と一致するようにテキスト埋め込みを最適化することで、オブジェクトレベルの制御色付けを可能にすること。
  • 構造的・背景的整合性を保持しつつ、テキストから画像への色の意味的伝達を正確に行うこと。

提案手法

  • 色付け済み画像とその対応するテキストプロンプトをポジティブペア、関連のないアンチカラーのテキストをネガティブペアとして扱うCLIPベースの対照的損失を用いて、事前学習済みのテキストto画像拡散モデルを微調整する。
  • 推論時にテキスト埋め込みを最適化し、生成された色付け済み画像がターゲットのテキストプロンプトと一致するようにする。これにより、再訓練なしに文脈内色付けが可能になる。
  • CoCosNetを用いた空間的アライメントモジュールを導入し、入力のグレースケール画像から構造的詳細を拡散生成出力に転送することで、画像のレイアウトと細部を保持する。
  • 2段階パイプラインを採用:まず、対照的微調整による生成的色の事前分布を用いて初期色付けを生成し、次に最適化されたテキスト埋め込みと高品質再構成を用いて結果を精錬する。
  • 効率的で高精細な画像生成を実現するため、DDIMベースのサンプリングを活用し、ほぼ完全な逆変換と高速な推論を可能にする。
  • コンテンツと色のガイドラインのバランスを取るための補間パラメータ η を導入し、曖昧または不正確なプロンプト下でも柔軟な制御を可能にする。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みの拡散モデルが、追加の入力がなくともテキストプロンプトのみで高精細で多様かつ意味的に正確な色付けを生成できるか?
  • RQ2再訓練や微調整なしに、プロンプトの変更のみで異なる色の結果を生成できる文脈内色付けが実現できるか?
  • RQ3特定の画像領域と一致するようにテキスト埋め込みをアライメントすることで、オブジェクトレベルの制御色付けが可能か?
  • RQ4空間的アライメントモジュールは、色の転送と並行して構造的詳細をどれほど効果的に保持できるか?
  • RQ5ベースライン色付け手法と比較して、対照的損失は色の正確性と多様性をどの程度向上させるか?

主な発見

  • ユーザー評価では、画像の質と意味的整合性の両面で、DiffColorが先行SOTA手法を上回る最高スコアを達成した。
  • アブレーションスタディの結果、空間的アライメントにより、第1段階でPSNRが21.13から29.83へ、SSIMが0.7643から0.9063へと向上し、構造的保持が顕著に向上した。
  • CLIPベースのポジティブ/ネガティブペアを用いた対照的損失は、色出力を現実的な色空間内に制限し、色の正確性を向上させるのに効果的であった。
  • 第2段階は、実際のカラー画像に適用された場合、2段階パイプラインに依存しない意味的色編集ツールとしての汎用性を示した。
  • 補間パラメータ η により柔軟な制御が可能であり、η を増加させることで、曖昧または不正確なプロンプト下でも色のバリエーションを探索できる。
  • ユーザー評価により、DiffColorは特に色が曖昧な複雑なシーンにおいて、ベースラインと比較してより鮮やかでカラフルで意味的に整合性のある結果を生成することが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。