[论文解读] HyperInverter: Improving StyleGAN Inversion via Hypernetwork
HyperInverter 提出了一种基于编码器的两阶段方法,用于 StyleGAN 重建,实现了高保真度重建与强大可编辑性,并具备快速推理能力。首先将图像编码到 StyleGAN2 的 W 空间以保证可编辑性,然后利用超网络预测残差权重,对生成器进行微调,从而在推理过程中无需优化或微调即可恢复丢失的细节。
Real-world image manipulation has achieved fantastic progress in recent years as a result of the exploration and utilization of GAN latent spaces. GAN inversion is the first step in this pipeline, which aims to map the real image to the latent code faithfully. Unfortunately, the majority of existing GAN inversion methods fail to meet at least one of the three requirements listed below: high reconstruction quality, editability, and fast inference. We present a novel two-phase strategy in this research that fits all requirements at the same time. In the first phase, we train an encoder to map the input image to StyleGAN2 $\mathcal{W}$-space, which was proven to have excellent editability but lower reconstruction quality. In the second phase, we supplement the reconstruction ability in the initial phase by leveraging a series of hypernetworks to recover the missing information during inversion. These two steps complement each other to yield high reconstruction quality thanks to the hypernetwork branch and excellent editability due to the inversion done in the $\mathcal{W}$-space. Our method is entirely encoder-based, resulting in extremely fast inference. Extensive experiments on two challenging datasets demonstrate the superiority of our method.
研究动机与目标
- 解决 GAN 重建中的重建-可编辑性权衡问题,其中 W 空间可实现可编辑性但重建质量差,而 W+ 空间可实现更好的重建质量但损失了可编辑性。
- 克服基于优化或微调的重建方法带来的高推理成本,这些方法因速度过慢而不适用于实时或交互式应用。
- 开发一种完全基于编码器的方法,在保持快速推理的同时,实现与当前最先进的基于优化的方法(如 PTI)相当的重建质量。
- 通过联合插值潜在码与生成器权重,实现高质量图像插值,提升视觉一致性与细节保留能力。
提出的方法
- 第一阶段:使用标准编码器将真实图像映射到预训练的 StyleGAN2 生成器的 W 空间,以确保高可编辑性。
- 第二阶段:采用一系列超网络,预测用于微调生成器原始参数的残差权重,从而恢复在 W 空间编码过程中丢失的细粒度细节。
- 这些超网络以输入图像和初始重建结果为条件,生成对生成器卷积层的逐层残差更新。
- 经过预测残差权重更新后的生成器,合成最终的重建图像,结合了 W 空间的可编辑性与增强的重建保真度。
- 该方法在推理过程中避免了每张图像的优化或生成器微调,从而实现接近实时的性能。
- 提出了一种新颖的插值方法,通过同时插值潜在码与生成器权重,提升了图像间过渡的视觉质量。
实验结果
研究问题
- RQ1完全基于编码器的方法能否在保持快速推理的同时,实现与基于优化的方法(如 PTI)相当的重建质量?
- RQ2超网络能否在无需每张图像优化或生成器微调的情况下,有效恢复在 W 空间重建过程中丢失的细粒度图像细节?
- RQ3联合插值潜在码与生成器权重是否能带来比标准潜在码插值更平滑、更真实的图像过渡?
- RQ4架构选择(如超网络的隐藏维度 D 或更新层)如何影响重建质量与细节恢复效果?
主要发现
- HyperInverter 在推理速度上比 PTI 快 3000 倍,同时实现了与 PTI 相当的重建质量,后者是当前最先进的基于优化的方法。
- 第二阶段使用超网络至关重要:消融实验证明,若移除该阶段,重建质量显著下降,导致面部彩妆、阴影和背景等细节的丢失。
- 完整的超网络设计(即使用逐层外观码)优于简化版本,后者在各层间共享码或仅使用输入图像特征。
- 当超网络的隐藏维度 D=256 时性能最佳,消融实验表明,D 过小或过大均会导致性能下降。
- 残差权重更新在主生成器模块及最高分辨率(1024×1024)处最为显著,证实第二阶段专注于微调面部细节。
- 所提出的插值方法(同时插值潜在码与生成器权重)可生成更平滑、更真实的图像过渡,并在保留帽子、手部等细粒度细节方面优于标准潜在插值方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。