[论文解读] ZstGAN: An Adversarial Approach for Unsupervised Zero-Shot Image-to-Image Translation
该论文提出ZstGAN,一种用于无监督零样本图像到图像翻译(UZSIT)的生成对抗网络,可在无需成对训练数据的情况下实现未见图像领域间的翻译。通过利用视觉和属性编码器建模领域特定特征,并解耦领域不变特征,ZstGAN在CUB和FLO数据集上达到最先进性能,在FLO数据集未见领域的top-1准确率达到34.06%。
Image-to-image translation models have shown remarkable ability on transferring images among different domains. Most of existing work follows the setting that the source domain and target domain keep the same at training and inference phases, which cannot be generalized to the scenarios for translating an image from an unseen domain to another unseen domain. In this work, we propose the Unsupervised Zero-Shot Image-to-image Translation (UZSIT) problem, which aims to learn a model that can translate samples from image domains that are not observed during training. Accordingly, we propose a framework called ZstGAN: By introducing an adversarial training scheme, ZstGAN learns to model each domain with domain-specific feature distribution that is semantically consistent on vision and attribute modalities. Then the domain-invariant features are disentangled with an shared encoder for image generation. We carry out extensive experiments on CUB and FLO datasets, and the results demonstrate the effectiveness of proposed method on UZSIT task. Moreover, ZstGAN shows significant accuracy improvements over state-of-the-art zero-shot learning methods on CUB and FLO.
研究动机与目标
- 解决现有图像到图像翻译模型在推理阶段无法泛化到未见领域的问题。
- 提出新问题设定:无监督零样本图像到图像翻译(UZSIT),即在无成对数据且目标领域在训练期间未见的情况下进行翻译。
- 通过利用视觉与属性模态之间的语义一致性,构建可泛化到未见领域的框架。
- 在无需源域与目标域之间任何标注或成对数据的前提下,实现零样本翻译。
- 解耦领域不变特征与领域特定特征,以支持灵活且可泛化的图像翻译。
提出的方法
- 提出双编码器架构:视觉到语义编码器用于图像输入,属性到语义编码器用于文本描述,联合训练以建模领域特定特征分布。
- 使用领域特定判别器进行对抗训练,确保生成的特征与真实领域特定特征无法区分。
- 引入共享编码器,从输入图像中提取领域不变特征,并与领域特定特征结合用于图像生成。
- 应用多种损失组件:视觉与属性特征上的分类损失、领域特定与共享特征的对抗损失、循环一致性重建损失,以及互信息最大化以对齐特征。
- 通过从图像或文本中插值领域特定特征,实现未见领域之间的连续过渡,证明模型在连续语义空间中具备泛化能力。
- 以完全无监督方式训练模型,仅依赖来自已见领域的未配对数据及未见领域属性描述。
实验结果
研究问题
- RQ1生成模型能否在无需任何成对数据的情况下,泛化到训练期间未见的领域进行图像到图像翻译?
- RQ2如何有效解耦领域特定与领域不变特征,以实现零样本翻译?
- RQ3视觉与属性模态之间的语义一致性在多大程度上提升零样本图像翻译中的泛化能力?
- RQ4已见领域的数量如何影响在未见领域上零样本翻译的性能?
- RQ5模型能否通过特征插值泛化到未见领域的连续变化?
主要发现
- ZstGAN在FLO数据集未见领域上达到34.06%的top-1准确率,显著优于当前最先进的零样本学习方法。
- 消融实验表明,若移除任意损失组件(如分类损失、对抗损失、重建损失或互信息损失),性能均出现显著下降,证实完整训练方案的必要性。
- 随着已见领域数量的增加,未见领域上的性能持续提升,FLO数据集上top-1准确率从M=20时的17.13%提升至M=82时的34.06%。
- 从图像或文本中插值领域特定特征可生成平滑、连续的翻译结果,证明模型具备在连续语义空间中泛化到未见领域的能力。
- 模型成功保留了领域不变内容(如背景元素),同时适应新的领域特定风格,表明特征解耦有效。
- ZstGAN的泛化能力超越离散领域标签,可为训练集中未出现的未见领域生成合理翻译结果,验证其零样本能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。