[论文解读] MIGS: Meta Image Generation from Scene Graphs
MIGS 提出了一种元学习框架,用于从场景图进行少样本图像生成,即使训练样本有限,也能实现多样化且逼真的图像合成。通过使用元优化初始化对预训练生成器进行微调,MIGS 在 BDD100k 和 Action Genome 数据集上显著优于基线方法,FID 和 KID 分数最高提升 2 倍,并在少样本设置下提升了精度/召回率。
Generation of images from scene graphs is a promising direction towards explicit scene generation and manipulation. However, the images generated from the scene graphs lack quality, which in part comes due to high difficulty and diversity in the data. We propose MIGS (Meta Image Generation from Scene Graphs), a meta-learning based approach for few-shot image generation from graphs that enables adapting the model to different scenes and increases the image quality by training on diverse sets of tasks. By sampling the data in a task-driven fashion, we train the generator using meta-learning on different sets of tasks that are categorized based on the scene attributes. Our results show that using this meta-learning approach for the generation of images from scene graphs achieves state-of-the-art performance in terms of image quality and capturing the semantic relationships in the scene. Project Website: https://migs2021.github.io/
研究动机与目标
- 解决仅用少量训练样本从场景图生成多样化且逼真图像的挑战。
- 克服现有模型(如 SG2Im)在少样本场景下泛化能力差和记忆训练样本的局限性。
- 通过学习图像生成模型的元优化初始化,提升零样本和少样本泛化能力。
- 在极少监督下实现对多样化属性(如光照、物体外观)的高保真图像合成。
- 在真实世界数据集(如 BDD100k 和 Action Genome)上,于多种样本设置(5、10、160-shot)下展示稳健性能。
提出的方法
- 采用元学习范式,使模型能够通过少样本微调快速适应新的图像生成任务。
- 使用图卷积网络(GCN)将场景图结构编码为主体、谓词和对象关系的节点嵌入。
- 集成一个条件图像生成器(SPADE 或 CRN),利用布局和语义图生成受场景图输入条件约束的图像。
- 应用元优化,学习生成器的初始化,使其仅用 5–160 张支持图像即可快速适应新任务。
- 在每个任务上使用少量支持图像及其对应场景图进行微调,然后为查询场景图生成图像。
- 利用感知和基于度量的评估方法(FID、KID、精度/召回率)验证生成图像的泛化能力和多样性。
实验结果
研究问题
- RQ1元学习能否在减少对训练样本记忆的同时,提升从场景图进行少样本图像生成的性能?
- RQ2MIGS 在不同样本设置(5、10、160-shot)下生成多样化且逼真图像的表现如何?
- RQ3MIGS 在未见属性(如光照条件、物体颜色)上泛化的程度如何,这些属性未出现在支持集中?
- RQ4与基线模型(如 SG2Im)相比,MIGS 在图像保真度和模式覆盖方面表现如何?
- RQ5MIGS 能否在多样化的真实世界场景中有效捕捉场景图中的复杂语义关系?
主要发现
- 在 BDD100k 数据集上,MIGS + SPADE 在 5-shot 学习中实现召回率(F₈)0.74 和精度(F₁/₈)0.823,显著优于基线模型 SG2Im + SPADE(F₈: 0.329,F₁/₈: 0.438)。
- 在 Action Genome 数据集上,MIGS + SPADE 实现 F₈ = 0.60 和 F₁/₈ = 0.50,显著优于 SG2Im + SPADE(F₈: 0.59,F₁/₈: 0.31)。
- 该模型生成了训练支持集中未见的多样化属性图像(如不同颜色的汽车、不同光照条件),展示了超越记忆化的强大泛化能力。
- 在 160-shot 和 10-shot 设置下,MIGS 生成了具有精细细节(如云彩、道路反光)的高保真图像,而 5-shot 设置下的表现则在多样性和细节上更为有限。
- 用户研究表明,MIGS 生成的图像在感知上更受青睐,且更符合指定属性(如白天、夜晚)的要求,优于基线模型。
- 定量指标(FID、KID)显示,MIGS 生成的图像更接近真实数据分布,其多样性与真实感均优于基线模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。