[論文レビュー] Lafite2: Few-shot Text-to-Image Generation
Lafite2は、検索拡張型構築と対照的潜在最適化を用いて擬似テキスト特徴を合成する、少量の画像テキストペアデータでの微調整に適した非教師あり事前学習手法を提案する。完全教師あり設定下でMS-COCO上に6.78の最先端FIDスコアを達成し、最小限のデータおよび計算コストでゼロショットおよび少データ設定でも競争力ある結果を達成した。
Text-to-image generation models have progressed considerably in recent years, which can now generate impressive realistic images from arbitrary text. Most of such models are trained on web-scale image-text paired datasets, which may not be affordable for many researchers. In this paper, we propose a novel method for pre-training text-to-image generation model on image-only datasets. It considers a retrieval-then-optimization procedure to synthesize pseudo text features: for a given image, relevant pseudo text features are first retrieved, then optimized for better alignment. The low requirement of the proposed method yields high flexibility and usability: it can be beneficial to a wide range of settings, including the few-shot, semi-supervised and fully-supervised learning; it can be applied on different models including generative adversarial networks (GANs) and diffusion models. Extensive experiments illustrate the effectiveness of the proposed method. On MS-COCO dataset, our GAN model obtains Fréchet Inception Distance (FID) of 6.78 which is the new state-of-the-art (SoTA) of GANs under fully-supervised setting. Our diffusion model obtains FID of 8.42 and 4.28 on zero-shot and supervised setting respectively, which are competitive to SoTA diffusion models with a much smaller model size.
研究の動機と目的
- 大規模な画像・テキストペアデータセット上でテキストから画像生成モデルを学習する際の高コストとデータ要件を低減すること。
- 画像のみのデータセット上で効果的な事前学習を可能にすることで、少量学習および半教師ありテキストから画像生成の性能を向上させること。
- 異なるアーキテクチャ(GANや拡散モデルを含む)に柔軟に適応可能で、リソースを最小限に抑えた方法を開発すること。
- 完全教師ありモデルと言語フリー(テキストフリー)モデルの性能ギャップを埋めること。
提案手法
- Lafite2は、まず画像特徴を用いてCLIPのマルチモodal埋め込み空間から関連するテキスト特徴を検索することで、擬似テキスト特徴を合成する。
- 検索された擬似テキスト特徴を画像特徴とより良い整合性を持つように、対照的潜在最適化(CLO)を適用して精緻化する。
- 事前最適化の前に、特徴の質と関連性を向上させるために、検索拡張アプローチを用いる。
- ガウスノイズと潜在最適化のコンponentsを統合することで、事前学習中のロバストネスと特徴品質を向上させる。
- このフレームワークは、GANベース(Lafite2_GAN)および拡散モデルベース(Lafite2_LDM)の両方のアーキテクチャに適用可能である。
- 最小限の実際の画像・テキストペアを用いて微調整することで、強力な少量学習性能を実現する。
実験結果
リサーチクエスチョン
- RQ1画像データのみで、ペアテキストアノテーションが一切ない状況でも、テキストから画像生成モデルが強力な性能を発揮できるか?
- RQ2本物のペアデータが存在しない状況で、擬似テキスト特徴を効果的に合成する方法は何か?
- RQ3検索拡張型の擬似テキスト特徴構築は、ランダムまたは摂動付き初期化に比べて、少量学習設定で優れた性能を発揮するか?
- RQ4提案手法は、最小限のデータで完全教師ありおよび少量学習設定の両方で最先端の結果を達成できるか?
- RQ5対照的潜在最適化(CLO)は、擬似テキスト特徴の質と整合性をどのように向上させるか?
主な発見
- Lafite2_GANは、完全教師あり学習下でMS-COCO上に6.78のFréchet Inception Distance(FID)を達成し、GANベースのモデルにおいて新たな最先端を記録した。
- Lafite2_LDMはゼロショット生成でFIDが8.42、教師あり設定で4.28を達成し、はるかに小型なモデルサイズで他の言語フリーのモデルを上回った。
- 検索拡張コンponentは、特に1%未満のデータ量(0.1%〜1%)の低データ環境下で顕著に性能を向上させた。
- 対照的潜在最適化(CLO)により、画像・テキスト対応関係が向上し、完全教師あり設定下でSOA-Iが74.48(ベースライン)から74.88に向上した。
- 検索、CLO、ガウスノイズのすべてのコンponentsを組み合わせることで、最良の全体的性能が得られ、過学習が抑制され、一般化性能が向上した。
- Lafite2による事前学習 followed by 微調整は、完全データセットの10%しか使用しない状況でも、完全に訓練を再開する場合よりも優れた性能を示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。