[论文解读] Full-body High-resolution Anime Generation with Progressive Structure-conditional Generative Adversarial Networks
本文提出渐进式结构条件生成对抗网络(PSGAN),一种通过在训练过程中逐步对多尺度姿态关键点图进行条件控制,从而生成1024×1024分辨率全幅动漫角色图像并实现精确姿态控制的方法。与以往的GAN相比,该方法在结构一致性和图像质量方面表现更优,可实现从潜在码和姿态序列出发的可控、高保真动漫动画生成。
We propose Progressive Structure-conditional Generative Adversarial Networks (PSGAN), a new framework that can generate full-body and high-resolution character images based on structural information. Recent progress in generative adversarial networks with progressive training has made it possible to generate high-resolution images. However, existing approaches have limitations in achieving both high image quality and structural consistency at the same time. Our method tackles the limitations by progressively increasing the resolution of both generated images and structural conditions during training. In this paper, we empirically demonstrate the effectiveness of this method by showing the comparison with existing approaches and video generation results of diverse anime characters at 1024x1024 based on target pose sequences. We also create a novel dataset containing full-body 1024x1024 high-resolution images and exact 2D pose keypoints using Unity 3D Avatar models.
研究动机与目标
- 为解决生成高分辨率、结构一致的全幅动漫角色图像并实现精确姿态控制的挑战。
- 克服现有GAN在生成角色图像时难以同时保证高图像质量和全局结构保真度的局限性。
- 开发一种训练框架,逐步提升分辨率,同时在每个尺度上对姿态关键点图进行条件控制。
- 构建一个新型的大规模数据集,包含1024×1024分辨率的动漫图像及其精确的2D姿态关键点标注,用于训练与评估。
- 通过使用学习到的潜在变量对连续姿态序列进行条件控制,实现可控的动画生成。
提出的方法
- PSGAN在Progressive GAN基础上引入多尺度结构条件:姿态关键点图在每个分辨率层级上被下采样,并输入生成器与判别器。
- 生成器在每个分辨率阶段从潜在向量和姿态图生成图像,判别器则使用相同的姿态图评估图像的真实感与结构一致性。
- 姿态关键点图通过直接从Unity 3D角色模型提取坐标生成,确保零估计误差并实现高精度。
- 网络采用渐进式训练:从4×4开始逐步增加至1024×1024,同时逐步降低批量大小和初始初始学习率以控制GPU显存占用。
- 采用WGAN-GP损失函数,n_critic=1以稳定训练过程,且生成器在各阶段采用自适应学习率逐步降低。
- 结构条件以热力图为表示:关键点位置值为1,其余位置为-1,各尺度间通过最大池化操作实现下采样。
实验结果
研究问题
- RQ1GAN框架能否在姿态条件控制下生成1024×1024分辨率的全幅动漫图像,并保持高结构保真度与图像质量?
- RQ2与单尺度条件控制相比,对多尺度姿态关键点图进行渐进式条件控制是否能提升结构一致性?
- RQ3在姿态条件图像生成任务中,PSGAN相较于基线GAN(如Progressive GAN和PG2)在图像质量和结构准确性方面表现如何?
- RQ4PSGAN能否通过固定潜在码并输入连续姿态序列,实现平滑且可控的动画生成而无需重新训练?
- RQ5使用来自Unity 3D模型的合成精确姿态关键点数据在多大程度上提升了训练稳定性和生成质量?
主要发现
- PSGAN成功生成了1024×1024分辨率的全幅动漫角色图像,视觉质量高,结构一致性强,定性结果已充分验证。
- 与Progressive GAN相比,PSGAN生成的图像更符合全局姿态结构,显著减少了如肢体错位等伪影。
- PSGAN在图像质量上优于PG2,即使PG2使用了成对的源图像并依赖图像到图像的翻译,PSGAN仍能生成更清晰、更细节丰富的结果。
- 该方法实现了可控的动画生成:通过固定潜在码并输入连续姿态序列,可生成平滑动画而无需重新训练。
- 通过Unity 3D模型精确提取姿态关键点所构建的新型Avatar Anime-Character数据集,为未来动漫生成研究提供了高质量、可扩展的资源。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。