[论文解读] Exploring Patch-wise Semantic Relation for Contrastive Learning in Image-to-Image Translation Tasks
本文提出了一种用于图像到图像翻译的新型对比学习框架,通过在图像块之间建模语义关系的一致性(SRC)正则化和困难负样本挖掘,增强了特征对应关系。通过解耦对比学习并强制在异质语义关系之间保持一致性,该方法在单模态、多模态翻译以及 GAN 压缩任务中均实现了最先进性能,显著提升了 FID 和 mIoU 指标。
Recently, contrastive learning-based image translation methods have been proposed, which contrasts different spatial locations to enhance the spatial correspondence. However, the methods often ignore the diverse semantic relation within the images. To address this, here we propose a novel semantic relation consistency (SRC) regularization along with the decoupled contrastive learning, which utilize the diverse semantics by focusing on the heterogeneous semantics between the image patches of a single image. To further improve the performance, we present a hard negative mining by exploiting the semantic relation. We verified our method for three tasks: single-modal and multi-modal image translations, and GAN compression task for image translation. Experimental results confirmed the state-of-art performance of our method in all the three tasks.
研究动机与目标
- 为了解决现有对比学习方法在图像到图像翻译中忽略图像内部多样化语义关系的局限性。
- 通过强制图像块之间语义关系的一致性,改善输入与输出图像之间的特征对应关系。
- 提出一种基于空间变化语义关系的困难负样本挖掘策略,以避免选择简单负样本。
- 在不依赖循环一致性约束的前提下,实现在单边图像翻译和 GAN 知识蒸馏任务中的最先进性能。
提出的方法
- 引入解耦对比学习(DCE),将对比目标与语义关系正则化分离。
- 提出语义关系一致性(SRC)正则化,以保持输入与输出图像块之间分布相似性和空间语义结构的一致性。
- 采用基于语义相关性的负样本选择策略,由学习到的图像块间关系引导负样本挖掘。
- 使用课程学习方案控制负样本的难度,提升训练稳定性。
- 将该方法应用于图像翻译与 GAN 压缩任务,实现教师模型到学生模型的关联知识迁移。
- 利用特征相似性图可视化并验证翻译前后语义关系的一致性。

实验结果
研究问题
- RQ1建模图像块之间的语义关系是否能提升单边图像到图像翻译中的特征对应关系?
- RQ2在异质语义关系上强制一致性对图像翻译质量有何影响?
- RQ3基于语义关系的困难负样本挖掘是否优于随机或均匀负样本采样?
- RQ4所提方法在保留翻译质量的前提下,能在多大程度上提升 GAN 压缩效果?
- RQ5该方法是否能在单模态、多模态以及 GAN 知识蒸馏任务中实现泛化?
主要发现
- 所提方法在 Horse→Zebra 数据集上实现了 34.4 的最先进 FID 分数,在 Cityscapes 数据集上达到 46.4,优于基线模型。
- 在 Cityscapes 数据集上,压缩后的学生模型 mIoU 达到 35.6,高于教师模型,表明语义一致性得到提升。
- 消融实验表明,加入 SRC 和困难负样本挖掘能持续提升性能,完整模型达到最佳效果。
- 相似性图可视化显示,SRC 有效保持了输入与输出之间一致的语义模式,而困难负样本挖掘则聚焦于语义相关的负样本。
- 该方法在性能损失极小的情况下减小了模型规模,其 MACs 和 #Params 均低于基线学生模型,同时保持或提升了 FID 指标。
- 该模型在多种任务中表现出良好泛化能力,包括单模态翻译、多模态翻译以及 GAN 压缩,展现出强鲁棒性与可迁移性。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。