Skip to main content
QUICK REVIEW

[论文解读] Cross Attention Based Style Distribution for Controllable Person Image Synthesis

Xinyue Zhou, Mingyu Yin|arXiv (Cornell University)|Aug 1, 2022
Face recognition and analysis被引用 5
一句话总结

本文提出了一种基于交叉注意力的风格分布(CASD)模块,用于单阶段、可控的人像图像生成,通过注意力机制动态对齐源语义风格与目标姿态,实现姿态迁移和虚拟试穿。该方法在定量指标和用户研究中均达到最先进性能,同时在无需额外训练的情况下联合生成准确的语义分割图。

ABSTRACT

Controllable person image synthesis task enables a wide range of applications through explicit control over body pose and appearance. In this paper, we propose a cross attention based style distribution module that computes between the source semantic styles and target pose for pose transfer. The module intentionally selects the style represented by each semantic and distributes them according to the target pose. The attention matrix in cross attention expresses the dynamic similarities between the target pose and the source styles for all semantics. Therefore, it can be utilized to route the color and texture from the source image, and is further constrained by the target parsing map to achieve a clearer objective. At the same time, to encode the source appearance accurately, the self attention among different semantic styles is also added. The effectiveness of our model is validated quantitatively and qualitatively on pose transfer and virtual try-on tasks.

研究动机与目标

  • 在单次训练阶段实现高保真、可控的人像图像生成,避免依赖不可靠的光流估计的多阶段流水线。
  • 解决现有方法在大形变情况下难以将源风格与目标姿态对齐的局限性。
  • 在无需单独训练语义分割模型的前提下,联合生成逼真的目标图像与分割图。
  • 通过显式控制语义区域风格,支持虚拟试穿和人脸替换等高级图像操作。

提出的方法

  • CASD模块利用交叉注意力计算目标姿态特征(查询)与源语义风格特征(键和值)之间的动态相似性,实现颜色与纹理在目标姿态上的软性路由。
  • 在不同语义风格之间应用自注意力机制,以建模其相互依赖关系,提升风格表征的保真度。
  • 通过投影头直接从目标姿态预测注意力矩阵,实现端到端训练并获得显式监督。
  • 利用新颖的AMCE损失,基于真实目标分割图对注意力矩阵施加约束,提升对齐精度与训练稳定性。
  • 通过在源图像与参考图像之间交换特定语义区域的风格特征,无需微调即可支持虚拟试穿与人脸替换。
  • 整个流水线在单阶段内完成训练,联合优化图像生成与分割图预测。

实验结果

研究问题

  • RQ1单阶段模型能否在不单独训练分割网络的前提下,联合生成逼真的人物图像与准确的分割图?
  • RQ2交叉注意力机制在对齐复杂、形变严重的目标姿态与源语义风格方面,效果如何?
  • RQ3在语义风格之间引入自注意力机制,是否能提升生成质量与风格一致性?
  • RQ4仅通过风格特征交换,能否有效实现虚拟试穿与人脸替换的适配?
  • RQ5AMCE损失通过利用分割图约束注意力矩阵,如何提升注意力对齐效果与模型性能?

主要发现

  • 完整CASD模型在DeepFashion数据集上的目标分割图预测中,平均IoU达到66.34,优于SPGNet的61.89。
  • 所有语义类别均实现IoU提升,其中上装类别(76.72 vs. 67.87)与背景类别(90.28 vs. 84.65)提升尤为显著。
  • 在用户研究中,姿态迁移与虚拟试穿任务的Jab分数均达到45.67%,表明生成结果具有极强的视觉真实感。
  • 消融实验表明,若移除任一组件——自注意力、基于姿态的注意力矩阵预测或AMCE损失——性能均出现下降。
  • 模型在单阶段内成功生成逼真图像与分割图,无需额外的分割网络或光流估计网络。
  • 通过交换特定身体部位的风格特征,模型可实现零样本虚拟试穿与人脸替换,视觉保真度优于ADGAN与PISE。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。