[論文レビュー] Ctrl-Adapter: An Efficient and Versatile Framework for Adapting Diverse Controls to Any Diffusion Model
Ctrl-Adapter は、バックボーンや ControlNet を微調整せずに、事前学習済み ControlNet を任意の画像・動画拡散モデルに軽量かつパラメータ効率的に適応するフレームワークです。空間的・時間的モジュールを備えた学習可能なアダプタ層(潜在的スキッピングおよび逆タイムステップサンプリングを含む)を導入することで、多様な制御条件下で高品質な画像・動画生成を実現し、DAVIS 2017 などの動画ベンチマークで最先端の結果を達成しています。トレーニングに必要な計算コストは 10 GPU 時間未塔です。
ControlNets are widely used for adding spatial control to text-to-image diffusion models with different conditions, such as depth maps, scribbles/sketches, and human poses. However, when it comes to controllable video generation, ControlNets cannot be directly integrated into new backbones due to feature space mismatches, and training ControlNets for new backbones can be a significant burden for many users. Furthermore, applying ControlNets independently to different frames cannot effectively maintain object temporal consistency. To address these challenges, we introduce Ctrl-Adapter, an efficient and versatile framework that adds diverse controls to any image/video diffusion model through the adaptation of pretrained ControlNets. Ctrl-Adapter offers strong and diverse capabilities, including image and video control, sparse-frame video control, fine-grained patch-level multi-condition control (via an MoE router), zero-shot adaptation to unseen conditions, and supports a variety of downstream tasks beyond spatial control, including video editing, video style transfer, and text-guided motion control. With six diverse U-Net/DiT-based image/video diffusion models (SDXL, PixArt-$α$, I2VGen-XL, SVD, Latte, Hotshot-XL), Ctrl-Adapter matches the performance of pretrained ControlNets on COCO and achieves the state-of-the-art on DAVIS 2017 with significantly lower computation (< 10 GPU hours).
研究の動機と目的
- 新しい拡散モデルのバックボーンに事前学習済み ControlNet を直接適用する際の非効率性と非互換性を解消すること。
- フレーム単位の ControlNet 推論を用いた動画生成における時間的整合性の欠如を克服すること。
- 未確認の制御条件や多様なバックボーンモデルに対し、ゼロショットで ControlNet を適応可能にすること。
- マルチコンディション制御、スパースフレーム制御、動画編集を含む柔軟な制御シナリオをサポートすること。
- 新しいバックボーン用に ControlNet をから学習する場合と比較して、トレーニングコストを削減すること。
提案手法
- 事前学習済み ControlNet とターゲット拡散モデルの両方のパラメータを凍結したまま、ControlNet の特徴を融合するアダプタ層を学習する。
- 空間的・時間的モジュールを備えた二本のブランチアーキテクチャを導入:空間的詳細には空間畳み込みとアテンション、時間的整合性には時間的畳み込みとアテンションを適用。
- 潜在的スキッピングを実装し、ControlNet 入力と拡散モデルの潜在空間を分離することで、ノイズスケールの違いに対する耐性を向上させる。
- 逆タイムステップサンプリングを適用し、新しいバックボーンの連続的拡散タイムステップスケジューラーと ControlNet 特徴を整合させる。
- 複数の事前学習済み ControlNet の出力を平均化(重み付き)することでマルチコンディション制御を実現。
- SDXL、I2VGen-XL、SVD、Hotshot-XL など、さまざまなバックボーンモデルに対応可能なモジュラーなアダプタ設計を採用。

実験結果
リサーチクエスチョン
- RQ1バックボーンや ControlNet を微調整せずに、新しい画像・動画拡散モデルに事前学習済み ControlNet を効率的に適応できるフレームワークは存在するか?
- RQ2フレーム単位の ControlNet 特徴を用いた動画生成において、時間的整合性をどのように向上できるか?
- RQ3ゼロショット適応によって、未確認の制御条件や多様なバックボーンモデルに一般化できるか?
- RQ4視覚的品質と制御精度のバランスを最適化するためのアーキテクチャ的要素(例:アテンション、畳み込み、時間モジュール)として、どれが最も効果的か?
- RQ5マルチコンディション制御やスパースフレーム制御といった複雑な制御シナリオを、最小限の計算コストでサポートできるか?
主な発見
- 画像制御において COCO データセットで、ControlNet のフル微調整と同等の性能を達成し、SDXL では FID 4.05 を達成。
- I2VGen-XL における動画制御では、DAVIS 2017 で最先端の光流誤差 3.68 を達成し、すべてのベースラインを上回った。
- Ctrl-Adapter のトレーニングに必要な計算コストは 10 GPU 時間未塔であり、ControlNet をから学習する場合(例:SDv1.5 では 500–600 A100 時間)と比べて顕著に削減された。
- 潜在的スキッピングにより、ノイズスケールが異なるバックボーン(例:SVD)に対しても適応性が向上し、スパースフレーム制御でも有効に機能。I2VGen-XL では FID を 7.20 から 5.98 に低下。
- SC+TC+SA+TA の構成が、動画生成における視覚的品質(FID)と空間的制御(光流誤差)の両面で最良のバランスを達成した。
- Ctrl-Adapter は、未確認の制御条件へのゼロショット転送を可能にし、ControlNet 出力の単純平均化によりマルチコンディション制御をサポート。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。