[论文解读] Neural Texture Extraction and Distribution for Controllable Person Image Synthesis
本文提出了一种新颖的神经纹理提取与分布(NTED)框架,用于可控的人体图像合成,通过双注意力机制从参考图像中提取并重新组合解耦的语义神经纹理,以匹配目标姿态分布。该方法通过神经纹理融合与优化,实现了高保真度、高分辨率(512×352)的图像生成,并具备明确的外观控制能力。
We deal with the controllable person image synthesis task which aims to re-render a human from a reference image with explicit control over body pose and appearance. Observing that person images are highly structured, we propose to generate desired images by extracting and distributing semantic entities of reference images. To achieve this goal, a neural texture extraction and distribution operation based on double attention is described. This operation first extracts semantic neural textures from reference feature maps. Then, it distributes the extracted neural textures according to the spatial distributions learned from target poses. Our model is trained to predict human images in arbitrary poses, which encourages it to extract disentangled and expressive neural textures representing the appearance of different semantic entities. The disentangled representation further enables explicit appearance control. Neural textures of different reference images can be fused to control the appearance of the interested areas. Experimental comparisons show the superiority of the proposed model. Code is available at https://github.com/RenYurui/Neural-Texture-Extraction-Distribution.
研究动机与目标
- 实现对姿态和外观具有明确控制的可控人体图像合成。
- 解决CNN和标准注意力机制在建模长距离空间依赖关系以及高效空间变形方面的局限性。
- 提取解耦的、富有表现力的神经纹理,以表征语义实体(如面部、头发、服装)以实现细粒度的外观控制。
- 开发一种轻量化、高效的空问变换模块,避免在复杂形变和遮挡情况下产生伪影。
- 实现来自不同参考图像的神经纹理无缝融合,以实现连贯的外观操控。
提出的方法
- NTED操作利用双注意力机制从参考特征图中提取分层的语义神经纹理。
- 提取阶段通过空间感知注意力机制收集来自参考图像的特征,以隔离语义实体。
- 分布阶段基于从目标姿态学习到的空间分布,通过软注意力选择重新组合神经纹理。
- 多尺度生成网络集成NTED模块,以预测条件语义分布并重建图像。
- 提出一种优化方法,自动搜索融合来自不同参考图像的神经纹理的插值系数。
- 模型采用标准GAN损失函数进行训练,以确保图像的真实感和感知质量。

实验结果
研究问题
- RQ1基于神经纹理的方法在人体图像合成中,是否能比传统CNN或基于光流的方法实现更精确且无伪影的图像形变?
- RQ2解耦的神经纹理在表征面部、头发和服装等语义实体方面,是否能有效支持外观控制?
- RQ3所提出的NTED操作在高分辨率图像合成任务中,是否在效率和性能方面优于标准注意力机制?
- RQ4来自不同参考图像的神经纹理在多大程度上可以融合,以生成连贯且逼真的图像并实现可控外观?
- RQ5该模型在未见姿态、服装和身份的情况下是否具备良好的泛化能力,尤其是在复杂形变条件下?
主要发现
- 所提模型的Fréchet Inception Distance(FID)为8.6838,感知LPIPS得分为0.1752,优于基线模型、基于风格的模型以及标准注意力模型。
- 该模型在SSIM(0.7182)方面表现具有竞争力,且FLOPs(103.99 G)低于标准注意力模型(219.94 G),表明其具有高效率。
- 定性结果表明,即使在严重姿态变化和遮挡情况下,也能忠实重建复杂纹理与结构。
- 通过神经纹理融合实现的外观控制生成了连贯结果,不同参考图像中的服装与面部特征实现了无缝融合。
- 消融实验表明,与基线方法相比,NTED模块显著提升了纹理保真度与空间一致性。
- 失败案例主要出现在低频出现的姿态、服装或真实场景中的人像上,表明在引入更多样化的训练数据后仍有改进空间。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。