[论文解读] Mask Based Unsupervised Content Transfer
本文提出了一种基于掩码的无监督内容迁移方法,通过新型注意力机制引导生成的掩码,将域不变内容与域特定内容解耦,实现在无需重建整幅图像的前提下实现高质量、局部化的内容迁移。该方法在内容迁移质量与多样性方面达到最先进水平,同时仅使用类别级标注即可实现迁移内容的弱监督语义分割。
We consider the problem of translating, in an unsupervised manner, between two domains where one contains some additional information compared to the other. The proposed method disentangles the common and separate parts of these domains and, through the generation of a mask, focuses the attention of the underlying network to the desired augmentation alone, without wastefully reconstructing the entire target. This enables state-of-the-art quality and variety of content translation, as demonstrated through extensive quantitative and qualitative evaluation. Our method is also capable of adding the separate content of different guide images and domains as well as remove existing separate content. Furthermore, our method enables weakly-supervised semantic segmentation of the separate part of each domain, where only class labels are provided. Our code is publicly available at https://github.com/rmokady/mbu-content-tansfer.
研究动机与目标
- 解决在其中一个域包含另一域不存在的附加属性(如眼镜)的未配对域之间的无监督内容迁移问题。
- 通过仅关注目标图像的相关区域来提升生成质量,避免对无关细节进行浪费性重建。
- 实现灵活的内容操控,包括在图像间添加、移除或交换属性。
- 仅使用类别级标签即可实现迁移内容的弱监督语义分割。
- 在无需成对训练数据或显式分割标注的情况下实现内容与风格的解耦。
提出的方法
- 该方法采用类似自编码器的解耦架构,将域不变内容(跨域共享)与域特定内容(每个域独有)分离。
- 掩码生成网络识别目标图像中应添加域特定内容的空间区域,实现局部注意力并减轻重建负担。
- 网络通过循环一致性损失、双域重建损失以及一种新型解耦损失($\mathcal{L}_{DC}$)联合训练,以确保语义分离。
- 对目标域应用自正则化损失($\mathcal{L}^{A}_{Recon2}$),以鼓励掩码仅捕获相关内容,提升掩码稀疏性与准确性。
- 该方法利用对域特定内容语义敏感的潜在空间,实现精确的定位与高保真度迁移。
- 掩码输出既用于内容迁移,也用于弱监督语义分割,无需边界框或像素级标注。
实验结果
研究问题
- RQ1我们能否在不重建整个目标图像的前提下,实现未配对域之间高质量、多样化的内容迁移?
- RQ2我们能否使用注意力掩码将内容迁移限制在特定区域,从而提升生成质量与效率?
- RQ3生成的掩码能否仅使用类别级标注作为弱监督语义分割图?
- RQ4该方法能否同时实现内容添加与移除,从而实现图像间灵活的属性交换?
- RQ5不同损失组件如何影响掩码质量、解耦效果与迁移性能?
主要发现
- 该方法在内容迁移质量与多样性方面达到最先进水平,在定量指标与定性评估中均优于先前的无监督方法。
- 迁移内容(如眼镜、胡须)的语义分割交并比(IoU)超过先前弱监督方法,眼镜的平均IoU为0.881,胡须为0.885。
- 消融研究显示,若移除$\mathcal{L}^{A}_{Recon2}$损失,分类器准确率下降9.7%,表明其在掩码定位与解耦中起关键作用。
- 若不使用$\mathcal{L}_{Cycle}$损失,掩码平均覆盖面部29%区域,但分类器准确率降至67.1%,表明循环一致性有助于保持语义正确性。
- 该方法即使在训练域外的图像上也能成功迁移内容,展现出强大的泛化能力与鲁棒性。
- 生成的掩码足够准确,可用于弱监督语义分割,在无任何真实分割监督的情况下实现高IoU。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。