Skip to main content
QUICK REVIEW

[論文レビュー] HIVE: Harnessing Human Feedback for Instructional Visual Editing

Shu Zhang, Xinyi Yang|arXiv (Cornell University)|Mar 16, 2023
Multimodal Machine Learning Applications被引用数 7
ひとこと要約

HIVEは、報酬モデリングとファインチューニングパイプラインを通じて人間のフィードバックを統合することにより、指導的視覚編集を向上させるフレームワークを提案する。人間の好みに適合するスケーラブルで計算的に効率的な手法を用いて、拡散モデルをファインチューニングする方法を導入し、100万件のトレーニングデータ、3,600件の報酬アノテーション、1,000件の評価データを用いて、定量的および定性的なベンチマークにおいて、先行手法を著しく上回る最先端のパフォーマンスを達成した。

ABSTRACT

Incorporating human feedback has been shown to be crucial to align text generated by large language models to human preferences. We hypothesize that state-of-the-art instructional image editing models, where outputs are generated based on an input image and an editing instruction, could similarly benefit from human feedback, as their outputs may not adhere to the correct instructions and preferences of users. In this paper, we present a novel framework to harness human feedback for instructional visual editing (HIVE). Specifically, we collect human feedback on the edited images and learn a reward function to capture the underlying user preferences. We then introduce scalable diffusion model fine-tuning methods that can incorporate human preferences based on the estimated reward. Besides, to mitigate the bias brought by the limitation of data, we contribute a new 1M training dataset, a 3.6K reward dataset for rewards learning, and a 1K evaluation dataset to boost the performance of instructional image editing. We conduct extensive empirical experiments quantitatively and qualitatively, showing that HIVE is favored over previous state-of-the-art instructional image editing approaches by a large margin.

研究の動機と目的

  • 人間の好みや意図と一致しない、特に特定の視覚的コンponentsに編集を正確に位置づけることができない指導的画像編集モデルのギャップを解消すること。
  • 拡散モデルのファインチューニングに人間のフィードバックを統合するスケーラブルで効率的な手法を開発すること。強化学習による高い計算コストを回避することを目的とする。
  • 指導的編集におけるデータバイアスを軽減するため、100万件のトレーニング例、3,600件の報酬アノテーション、1,000件の評価サンプルを含む大規模かつ多様なデータセットを収集すること。
  • 異なる出力に対して人間の好みから学習することで、モデルの汎化能力を向上させ、過剰または誤った編集を低減すること。
  • 人間のフィードバックが、編集指示と生成出力の間の整合性を顕著に向上させることを実証すること。特に、編集されていない画像領域の保持に特に有効である。

提案手法

  • 100万件規模の指導的画像編集データセットを収集し、新規データとInstructPix2Pixデータを組み合わせることで、ベースラインHIVEモデルを事前学習する。
  • アノテーターに1枚の画像-指示ペアに対して複数の生成出力をランク付けしてもらい、3,600件の報酬学習データセットを構築する。
  • ランク付けされた出力に基づいて人間の好みを予測する報酬モデル(RM)を訓練し、ユーザーの意図や品質に関する好みを捉える。
  • 推定された報酬を最小限の計算コストで拡散モデルの学習に統合する2つのスケーラブルなファインチューニング目的(重み付き報酬損失と条件付き報酬損失)を提案する。
  • 拡散モデルのU-Netにおけるファインチューニング中に推定報酬を活用し、高価なオンポリシー強化学習に依存せずに、編集指示との整合性を向上させる。
  • 性能と汎化能力の向上を図るため、最新のStable Diffusion v2.1バックボーンとOpenCLIPテキストエンコーダーを採用する。

実験結果

リサーチクエスチョン

  • RQ1人間のフィードバックは、ユーザーの意図や好みと整合性を持つ指導的画像編集モデルの性能を顕著に向上させることができるか?
  • RQ2拡散モデルのファインチューニングに人間のフィードバックを効率的に統合する方法は何か?計算コストが著しく増大するのを回避できるか?
  • RQ3大規模かつ人間がアノテートした報酬データセットは、指導的編集モデルのロバストネスと汎化能力をどの程度向上させるか?
  • RQ4人間のフィードバックを統合することで、不要な領域を変更する過剰または誤った画像変更が減少するか?
  • RQ5異なる報酬ファインチューニング目的(重み付き報酬損失対条件付き報酬損失)は、人間の好みとモデルパフォーマンスにおいてどのように比較されるか?

主な発見

  • HIVEに人間のフィードバックを適用したモデルは、ユーザーの好みの研究において、InstructPix2Pixおよび人間のフィードバックなしのHIVEを著しく上回り、ペairワイズ比較で最も高い票数を獲得した。
  • 人間のフィードバックにより、編集の正確な位置づけ(グランドイング)が向上し、意図しないオブジェクトの変更や編集されていない背景領域の変更といったエラーが減少した。
  • 人間のフィードバックを適用したモデルは、指示された編集領域以外の元の画像コンテンツをよりよく保持しており、不要な過剰編集を最小限に抑えた。
  • 条件付き報酬損失と重み付き報酬損失の両方のバリエーションが、人間の好みの順位付けにおいてほぼ同一の結果を示し、異なる最適化戦略に対しても堅牢であることが示された。
  • Stable Diffusion v1.5からv2.1にアップグレードすることでパフォーマンスがわずかにだが一貫して向上し、HIVEがv2.1を用いた場合、v1.5バージョンよりも高い人間の好みスコアを達成した。
  • 失敗事例には、空間的またはズームイン構成の指示の誤解、数え間違い、誤ったオブジェクトの色置き換えが含まれ、トレーニングデータのカバー範囲の制限が顕在化した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。