[论文解读] TuiGAN: Learning Versatile Image-to-Image Translation with Two Unpaired Images
TuiGAN 提出了一种仅使用两张未配对图像进行训练的一次性无监督图像到图像翻译模型,采用从粗到细的生成对抗网络,通过多尺度生成器和判别器金字塔逐步优化图像翻译。该模型在多样化的无监督图像到图像翻译任务中达到最先进性能,甚至在一次性训练场景下超越了在大规模数据集上训练的模型。
An unsupervised image-to-image translation (UI2I) task deals with learning a mapping between two domains without paired images. While existing UI2I methods usually require numerous unpaired images from different domains for training, there are many scenarios where training data is quite limited. In this paper, we argue that even if each domain contains a single image, UI2I can still be achieved. To this end, we propose TuiGAN, a generative model that is trained on only two unpaired images and amounts to one-shot unsupervised learning. With TuiGAN, an image is translated in a coarse-to-fine manner where the generated image is gradually refined from global structures to local details. We conduct extensive experiments to verify that our versatile method can outperform strong baselines on a wide variety of UI2I tasks. Moreover, TuiGAN is capable of achieving comparable performance with the state-of-the-art UI2I models trained with sufficient data.
研究动机与目标
- 解决在仅每类域各有一张图像的极端低数据场景下的无监督图像到图像翻译(UI2I)问题。
- 开发一种无需配对或大量未配对数据即可实现多功能 UI2I 的模型。
- 实现风格与高层语义内容的联合迁移,而不仅限于纹理或色彩模式。
- 证明一次性训练可达到与大规模数据集训练模型相当的性能。
提出的方法
- TuiGAN 采用两组条件 GAN 的金字塔结构,通过多尺度的生成器和判别器,从全局结构到局部细节逐步优化图像。
- 每一尺度的生成器结合前一尺度的特征,并应用尺度感知注意力机制,融合多尺度表征。
- 模型使用循环一致性损失、身份损失和总变差损失,以在翻译过程中保持内容并减少伪影。
- 每一尺度的生成器逐步优化图像,高层特征通过跳跃连接和注意力模块引导低层细节。
- 每一尺度的判别器用于区分来自源域和目标域的真实图像与该分辨率下的生成图像。
- 该架构通过在不同尺度上调节感受野,实现渐进式翻译,以最小数据捕捉域分布偏移。
实验结果
研究问题
- RQ1仅使用每类域各一张未配对图像,能否有效实现无监督图像到图像翻译?
- RQ2从粗到细的多尺度 GAN 架构是否能在一次性设置下提升特征学习与翻译保真度?
- RQ3模型能否在极低数据量下同时迁移低层风格(如颜色、纹理)与高层语义内容(如物体形状、结构)?
- RQ4循环损失、身份损失和注意力机制等关键组件在一次性翻译中的性能影响如何?
- RQ5仅用两张图像训练的模型能否达到与大规模数据集训练的最先进模型相当的性能?
主要发现
- TuiGAN 在一次性图像到图像翻译任务中优于强基线模型,涵盖 horse↔zebra、facade↔labels 和 aerial maps↔maps 等任务。
- 在 horse↔zebra 任务中,TuiGAN 的 SIFID 得分为 1.03×10⁻⁴,PD 得分为 6.16,所有变体中最低,表明其生成结果具有高真实感与内容保真度。
- 消融研究显示,若移除循环一致性损失或身份损失,将导致显著伪影与色彩失真,证实其关键作用。
- 完整模型在 N=4 个尺度时表现最佳,而 N=0(等价于 CycleGAN)无法保持全局结构或避免伪影。
- 在绘画到图像翻译任务中,TuiGAN 生成结果比 PhotoWCT、FUNIT 和 SinGAN 更准确、更细致,能有效保留内容并迁移细粒度风格模式。
- 尽管仅用两张图像训练,TuiGAN 的性能仍可与在大规模数据集上训练的最先进模型相媲美,证明其在低数据场景下的强大泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。