Skip to main content
QUICK REVIEW

[论文解读] Attention-based Fusion for Multi-source Human Image Generation

Stéphane Lathuilière, Enver Sangineto|arXiv (Cornell University)|May 7, 2019
Generative Adversarial Networks and Image Synthesis参考文献 34被引用 9
一句话总结

本论文提出了一种基于注意力机制的多源人体图像生成融合方法,其中通过目标姿态和多个源外观图像合成人物图像。通过引入姿态引导的特征对齐机制以及可学习的注意力模块,实现跨源特征的动态融合,该方法在图像质量与鲁棒性方面表现优越,尤其在源图像数量可变的情况下,优于Market-1501和DeepFashion数据集上的基线方法。

ABSTRACT

We present a generalization of the person-image generation task, in which a human image is generated conditioned on a target pose and a set X of source appearance images. In this way, we can exploit multiple, possibly complementary images of the same person which are usually available at training and at testing time. The solution we propose is mainly based on a local attention mechanism which selects relevant information from different source image regions, avoiding the necessity to build specific generators for each specific cardinality of X. The empirical evaluation of our method shows the practical interest of addressing the person-image generation problem in a multi-source setting.

研究动机与目标

  • 通过将人物图像生成任务扩展为依赖多个源外观图像而非单一源图像,实现任务泛化。
  • 解决多源设置中输入基数可变的挑战,即源图像数量在事前未固定。
  • 通过利用多个源图像之间的互补信息,提升图像保真度与细节准确性,尤其在遮挡或噪声条件下。
  • 设计一种灵活且可扩展的架构,避免因源图像数量不同而进行重新训练或架构修改。
  • 验证基于注意力机制的特征融合在结合多源表征以实现高质量图像合成方面的有效性。

提出的方法

  • 提出一种改进的U-Net生成器,其解码器采用基于注意力机制的方法,在每个分辨率层级上融合来自多个源图像的特征。
  • 引入一种姿态引导的特征编码器,根据目标姿态对每个源图像进行形变,实现在融合前的时空对齐。
  • 采用可学习的注意力机制,计算与源图像和位置相关的权重,以突出最具有信息量的区域。
  • 使用单个判别器的多源条件GAN损失,以处理任意数量的源图像,确保输出的一致性与真实性。
  • 在编码器与解码器之间应用跳跃连接,但将标准的特征平均操作替换为基于注意力的融合,以提升特征选择能力。
  • 引入一种2D注意力模块,其在空间位置和源索引上计算注意力图,实现动态、上下文感知的特征融合。

实验结果

研究问题

  • RQ1与单源方法相比,多源外观图像是否能提升人物图像生成的质量与鲁棒性?
  • RQ2深度生成模型如何在无需架构重训练的情况下,有效融合可变数量的源图像特征?
  • RQ3姿态引导的特征对齐在多源设置下的注意力机制融合性能中起到何种作用?
  • RQ4在多源图像生成中,基于注意力的特征选择是否优于简单的平均或拼接操作?
  • RQ5在图像质量与细节准确性方面,该方法在不同数量的源图像(如2张与5张)下是否具有良好的泛化能力?

主要发现

  • 完整模型采用基于注意力的融合,在Market-1501和DeepFashion数据集上均取得最高的Fréchet Inception Distance(FID)与Inception Score(IS);当使用两张源图像时,Market-1501的IS为3.474,DeepFashion的IS为3.421。
  • 消融实验表明,若移除姿态引导的特征对齐(Avg No-d),SSIM显著下降(Market-1501上从0.294降至0.258),证实了空间对齐的重要性。
  • 当使用五张源图像时,完整模型在Market-1501上的mask-SSIM达到0.788,在DeepFashion上达到0.774,分别优于基线方法Avg 0.026和0.018。
  • 基于注意力的模型(Full)减少了伪影并提升了细节生成能力,定性比较显示其在保留衣物细节(如标志和帽子)方面表现更优。
  • 2D注意力变体的SSIM更高,但IS低于完整模型,表明结构保真度与感知质量之间存在权衡。
  • 该方法对输入基数可变具有鲁棒性,在不修改架构的前提下,2张与5张源图像下均保持高性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。