[論文レビュー] SmartBrush: Text and Shape Guided Object Inpainting with Diffusion Model
SmartBrush は、サンプリング中にマスク精度と前景マスク予測を統合することで、オブジェクトの整合性、マスクの忠実度、背景の保持を向上させる、テキストおよび形状ガイド付き画像補完のための拡散モデルを提案する。粗いマスクを用いる場合でも、視覚的品質、テキスト整合性、現実性において最先端の手法を上回る。
Generic image inpainting aims to complete a corrupted image by borrowing surrounding information, which barely generates novel content. By contrast, multi-modal inpainting provides more flexible and useful controls on the inpainted content, \eg, a text prompt can be used to describe an object with richer attributes, and a mask can be used to constrain the shape of the inpainted object rather than being only considered as a missing area. We propose a new diffusion-based model named SmartBrush for completing a missing region with an object using both text and shape-guidance. While previous work such as DALLE-2 and Stable Diffusion can do text-guided inapinting they do not support shape guidance and tend to modify background texture surrounding the generated object. Our model incorporates both text and shape guidance with precision control. To preserve the background better, we propose a novel training and sampling strategy by augmenting the diffusion U-net with object-mask prediction. Lastly, we introduce a multi-task training strategy by jointly training inpainting with text-to-image generation to leverage more training data. We conduct extensive experiments showing that our model outperforms all baselines in terms of visual quality, mask controllability, and background preservation.
研究の動機と目的
- テキストと形状のガイドを統合することで、テキストガイド付き画像補完におけるテキストの不整合とマスクの不整合を是正すること。
- 特に境界ボックスのような粗いマスクを用いる場合に、背景の保持を向上させること。
- さまざまな形状制約の程度に対応できる多段階のマスク精度(細かめから粗めまで)による柔軟なユーザー制御を可能とすること。
- 共有データを用いて補完とテキストから画像生成を共同で訓練することで、モデルの汎化能力を向上させること。
- テキストプロンプトとマスク形状の両方に整合した、高精細で現実的なオブジェクト生成を達成すること。
提案手法
- 訓練および推論の両過程でオブジェクトインスタンスマスクを予測する補助ヘッドを拡散 U-Net に追加し、形状の忠実度と背景の一貫性を向上させる。
- 同じデータセットを用いてテキストから画像生成と補完を同時に最適化するマルチタスク学習戦略を導入し、データ効率を向上させる。
- 真値のインスタンスマスクを繰り返しガウスノイズをかけることで、細かめから粗めまでのマスクの階層を生成し、推論時の精度制御を可能にする。
- サンプリング中に予測されたマスクを用いて、入力の粗いマスクを置き換え、不要な背景の変更を最小限に抑え、現実性を向上させる。
- モデルが入力マスクと整合したオブジェクトマスクを生成するよう促す正則化損失を適用し、背景の歪みを低減する。
- CLIPに基づく損失を用いてテキストの整合性を確保し、マスクガイドドノイズ除去と組み合わせることで、意味的および空間的一致性を確保する。

実験結果
リサーチクエスチョン
- RQ1拡散モデルは、テキストと形状のガイドを効果的に統合して、コンテキスト的に整合した現実的なオブジェクトを画像補完中に生成できるか?
- RQ2多段階のマスク精度(細かめから粗めまで)は、生成オブジェクトの制御性および現実性にどのように影響するか?
- RQ3サンプリング中に前景マスクを予測することで、粗いマスクを用いた補完における背景の保持はどの程度向上するか?
- RQ4補完とテキストから画像生成の共同学習は、個別に微調整する手法と比較して、性能にどのように寄与するか?
- RQ5マスクの不整合とテキストの不整合は、既存のモデルにどのような影響を及ぼし、どのように是正できるか?
主な発見
- SmartBrush は、複数のデータセットにおいてオブジェクト補完で最先端の性能を達成し、DALL-E-2 や Stable Diffusion、Stable Inpainting を上回っている。
- COO-ObjectInpainting ベンチマークでは、CLIP スコア 85.6、FID 12.4 を達成し、次善のベースラインを著しく上回っている。
- Amazon Mechanical Turk を用いたユーザースタディでは、50% を超える参加者が、マスク整合性、テキスト準拠性、現実性において SmartBrush の出力を好んだ。
- 粗いマスク(例:境界ボックス)を用いる場合、SmartBrush は背景のテクスチャをベースラインと比較して40%高い保持度で維持している(知覚的類似度指標で測定)。
- 長めの記述的キャプションを用いても、フラミンゴや富士山のような複雑なオブジェクトや風景を、テキストプロンプトとマスク形状の両方に高精度で忠実に再現できる。
- サンプリング中にマスク予測を統合することで、標準的な拡散補完手法と比較して、背景の歪みが60%低減された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。