[论文解读] Fill-Up: Balancing Long-Tailed Data with Generative Models
本文提出 Fill-Up,一种通过利用文本内插(Textual Inversion)生成与真实数据高度对齐的特定类别合成图像来缓解图像识别中长尾数据分布的新方法。通过在预训练的文本到图像扩散模型(Stable Diffusion)中对每个类别优化随机初始化的文本标记,该方法生成多样化且领域对齐的图像,有效平衡了低频类别,在从零开始训练时于 ImageNet-LT、iNaturalist2018 和 Places-LT 上实现了最先进性能。
Modern text-to-image synthesis models have achieved an exceptional level of photorealism, generating high-quality images from arbitrary text descriptions. In light of the impressive synthesis ability, several studies have exhibited promising results in exploiting generated data for image recognition. However, directly supplementing data-hungry situations in the real-world (e.g. few-shot or long-tailed scenarios) with existing approaches result in marginal performance gains, as they suffer to thoroughly reflect the distribution of the real data. Through extensive experiments, this paper proposes a new image synthesis pipeline for long-tailed situations using Textual Inversion. The study demonstrates that generated images from textual-inverted text tokens effectively aligns with the real domain, significantly enhancing the recognition ability of a standard ResNet50 backbone. We also show that real-world data imbalance scenarios can be successfully mitigated by filling up the imbalanced data with synthetic images. In conjunction with techniques in the area of long-tailed recognition, our method achieves state-of-the-art results on standard long-tailed benchmarks when trained from scratch.
研究动机与目标
- 为解决真实世界图像识别中因罕见类别训练样本不足而导致的长尾数据分布挑战。
- 克服现有数据增强与生成方法在合成数据与真实世界领域分布对齐方面的局限性。
- 开发一种轻量化、高效的生成高质量、特定类别合成图像的方法,且无需使用特定类别的文本提示。
- 证明通过文本内插生成的合成数据在用于增强真实数据时,可显著提升在长尾基准上的识别性能。
- 通过简单的两阶段训练流程与 Balanced Softmax 损失,在标准长尾基准上实现最先进性能。
提出的方法
- 该方法采用文本内插技术,对每个类别优化随机初始化的文本标记,从而在无需类别名称或描述的情况下生成特定类别的图像。
- 提出一种两阶段训练流程:首先,利用优化后的文本标记生成合成图像;其次,在真实与合成图像的联合数据集上微调分类器。
- 该方法利用预训练的 Stable Diffusion v1.5 模型,在潜在空间中进行优化,以降低计算成本。
- 对每个类别单独应用文本内插,仅使用该类别的真实图像,使模型仅从图像数据中学习特定类别的视觉概念。
- 在训练过程中使用 Balanced Softmax 损失,进一步缓解类别不平衡问题,提升对罕见类别的泛化能力。
- 通过缩放超参数(如 1.0 或 7.5)控制生成图像的多样性与质量,单张图像的推理时间约为 3 秒(单张 GPU)。
实验结果
研究问题
- RQ1文本内插能否在无需特定类别文本提示的情况下,有效生成与真实世界数据分布对齐的合成图像?
- RQ2通过优化文本标记生成的合成数据,在从零开始训练时,是否能提升在长尾基准上的识别性能?
- RQ3与现有数据增强与生成方法相比,该方法在性能与领域对齐方面表现如何?
- RQ4该方法能否在训练样本少于 20 个的罕见类别上显著提升准确率?
- RQ5两阶段训练流程与 Balanced Softmax 损失对长尾设置下模型泛化能力的影响如何?
主要发现
- 所提方法在从零开始训练时,于 ImageNet-LT、iNaturalist2018 和 Places-LT 上均实现了最先进准确率,优于现有方法。
- 在 ImageNet-LT 上,该方法使用 260 万张填充后的图像,实现了 78.4% 的 top-1 准确率,显著优于基线模型。
- 在少样本场景下表现尤为突出,罕见类别(如仅 5 个样本的雪雉)的准确率显著高于基线方法。
- 在所有基准上,基于文本内插的生成方法在定性和定量评估中均优于其他图像到图像及跨模态生成方法。
- 两阶段训练流程与 Balanced Softmax 损失共同促进性能提升,尤其在长尾分布下效果显著。
- 该方法计算效率高:单张图像生成耗时约 3 秒,单类别优化耗时约 30 分钟(单张 RTX 3090)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。