[论文解读] Learning to Synthesize Fashion Textures
本文提出了一种新颖的无条件时尚纹理生成模型,该模型显式地将格拉姆矩阵作为纹理特征进行合成,利用递归自编码器建模多尺度特征相关性,并在潜在空间中使用高斯混合模型以增强多样性。该方法在真实感和多样性方面均达到当前最优性能,在FID和用户偏好基准测试中显著优于先前方法。
Existing unconditional generative models mainly focus on modeling general objects, such as faces and indoor scenes. Fashion textures, another important type of visual elements around us, have not been extensively studied. In this work, we propose an effective generative model for fashion textures and also comprehensively investigate the key components involved: internal representation, latent space sampling and the generator architecture. We use Gram matrix as a suitable internal representation for modeling realistic fashion textures, and further design two dedicated modules for modulating Gram matrix into a low-dimension vector. Since fashion textures are scale-dependent, we propose a recursive auto-encoder to capture the dependency between multiple granularity levels of texture feature. Another important observation is that fashion textures are multi-modal. We fit and sample from a Gaussian mixture model in the latent space to improve the diversity of the generated textures. Extensive experiments demonstrate that our approach is capable of synthesizing more realistic and diverse fashion textures over other state-of-the-art methods.
研究动机与目标
- 为解决时尚纹理无条件生成建模缺乏全面研究的问题,这些纹理与人脸或场景等一般物体不同。
- 开发一种从零开始生成逼真且多样化的时尚纹理的生成模型,克服现有像素空间或特征空间GAN的局限性。
- 通过专用的架构与训练组件,显式建模时尚纹理的多尺度、自相关及多模态特性。
- 通过拟合并从潜在空间中的高斯混合模型采样,提升样本多样性并避免模式崩溃。
- 在大规模、多样化的时尚纹理数据集上验证模型,证明其在视觉质量、FID和用户研究方面均优于现有基线方法。
提出的方法
- 该模型使用格拉姆矩阵——卷积特征的二阶统计量——作为纹理建模的核心内部表征,实现平稳性与空间不变性。
- 专用的G2V(格拉姆到向量)和V2G(向量到格拉姆)变换层执行结构保持的降维,以实现高效计算与生成。
- 递归自编码器架构在多个网络层上处理格拉姆矩阵,建模多尺度纹理特征之间的分层依赖关系。
- 推理过程中,潜在码从潜在空间中拟合的高斯混合模型(GMM)中采样,以更好地捕捉多模态分布并提升样本多样性。
- 生成器网络从合成的格拉姆矩阵重建高分辨率(256×256)纹理图像,采用条件生成过程以保持多层次特征一致性。
- 训练目标结合对抗性损失与感知重建损失,以确保图像质量的真实感与特征保真度。
实验结果
研究问题
- RQ1格拉姆矩阵能否作为无条件时尚纹理生成的有效且高效内部表征?
- RQ2如何在不同网络层之间有效建模并保持多尺度纹理特征的一致性?
- RQ3与标准高斯噪声相比,从潜在空间中学习到的GMM采样是否能显著提升生成时尚纹理的多样性与真实感?
- RQ4所提出的递归自编码器架构在保持纹理结构与一致性方面,相较于标准MLP基线方法,优势有多大?
- RQ5在视觉质量、FID和用户偏好方面,该方法与现有最先进纹理及时尚图像生成模型相比表现如何?
主要发现
- 所提方法在Fréchet Inception Distance(FID)上取得37.74的得分,显著优于基线方法,如DistGAN(41.97)、PSGAN(77.10)和TextureGAN(44.38)。
- 消融研究显示,使用全连接层进行格拉姆矩阵变换可获得略优的FID(37.32),但参数量高达184M,而本方法仅需10.8M参数,证明了更高的参数效率。
- 若将递归自编码器替换为MLP结构,FID上升至45.72,表明递归结构对保持多层级特征一致性与降低合成误差至关重要。
- 从潜在空间中的GMM采样可减少模式崩溃并提升多样性,2D PCA可视化显示其对真实数据分布的覆盖范围更广,而从N(0,I)采样则仅生成相似的条纹图案。
- 当使用标准高斯噪声而非GMM采样时,FID上升至40.83,证实GMM采样能有效提升多样性和真实感。
- 用户偏好研究确认,本方法生成的纹理在视觉上更受青睐,与定量FID及定性结果一致。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。