[论文解读] Variational Interaction Information Maximization for Cross-domain Disentanglement
本文提出交互信息自编码器(IIAE),一种基于变分推断的生成模型,通过信息论正则化实现域不变与域特定表征的解耦,无需对抗训练或梯度反转。IIAE 在 Sketchy Extended 数据集上实现了零样本草图图像检索(mAP: 0.573,P@100: 0.659)的最先进性能,甚至无需外部知识(如词嵌入)。
Cross-domain disentanglement is the problem of learning representations partitioned into domain-invariant and domain-specific representations, which is a key to successful domain transfer or measuring semantic distance between two domains. Grounded in information theory, we cast the simultaneous learning of domain-invariant and domain-specific representations as a joint objective of multiple information constraints, which does not require adversarial training or gradient reversal layers. We derive a tractable bound of the objective and propose a generative model named Interaction Information Auto-Encoder (IIAE). Our approach reveals insights on the desirable representation for cross-domain disentanglement and its connection to Variational Auto-Encoder (VAE). We demonstrate the validity of our model in the image-to-image translation and the cross-domain retrieval tasks. We further show that our model achieves the state-of-the-art performance in the zero-shot sketch based image retrieval task, even without external knowledge. Our implementation is publicly available at: https://github.com/gr8joo/IIAE
研究动机与目标
- 为解决跨域解耦问题,学习既解耦又信息丰富的表征,而不依赖启发式正则化技术。
- 将域不变与域特定表征的联合学习形式化为基于信息论的约束优化问题。
- 推导出目标函数的可计算下界,该下界能自然地与 VAE 的证据下界(ELBO)结合。
- 证明所提方法在图像到图像转换、跨域检索和零样本草图图像检索任务中的有效性。
- 表明 IIAE 即使在不依赖外部知识(如词嵌入或属性注释)的情况下,仍优于最先进模型在 ZS-SBIR 任务上的表现。
提出的方法
- 该方法将跨域解耦建模为多个信息约束的联合优化:在最大化共享表征与输入之间互信息的同时,最小化共享表征与域特定因子之间的互信息。
- 引入一种变分推断框架,采用结构化后验近似 qφ(zx, zs, zy|x, y) = qφX(zx|x)qφS(zs|x, y)qφY(zy|y),支持端到端训练。
- 目标函数被推导为一个下界,结合了 ELBO 与两项信息正则化项:一项通过最小化 I(ZS; ZX, ZY) 确保共享表征 ZS 是最小充分统计量;另一项通过最大化 I(ZS; X, Y) 确保 ZS 对 (X, Y) 具有最大信息量。
- 模型使用超参数 λ 平衡共享表征中不变性与压缩性之间的权衡。
- 该框架被实现为通过反向传播训练的生成模型,无需对抗训练或梯度反转层。
- 共享表征 ZS 通过余弦相似度用于下游任务(如图像检索)。
实验结果
研究问题
- RQ1能否设计一种基于信息论的严谨框架,实现域不变与域特定表征的联合学习,而无需对抗训练或梯度反转?
- RQ2如何在端到端训练中以可计算的方式近似共享表征与独占表征之间的互信息约束?
- RQ3所提方法在跨域图像转换与检索任务中,对解耦质量与下游性能的提升程度如何?
- RQ4该模型是否能在不依赖外部知识(如词嵌入或属性标签)的情况下,实现零样本草图图像检索的最先进性能?
- RQ5共享表征作为最小充分统计量,在泛化到未见类别时起到何种作用?
主要发现
- IIAE 在使用 Sketchy Extended 数据集的零样本草图图像检索(ZS-SBIR)基准上实现了最先进性能,mAP 达 0.573,P@100 达 0.659,优于使用外部知识(如词嵌入或 WordNet)的模型。
- 该模型优于专用基线模型(如 LCALE,mAP: 0.476;SEM-PCYC,mAP: 0.349),证明其在无属性或词级监督的情况下仍具有效性。
- 消融实验表明,两项信息正则化项——最小化 I(ZS; ZX, ZY) 与最大化 I(ZS; X, Y)——对性能均至关重要,λ 控制着不变性与信息量之间的平衡。
- 定性结果表明,即使检索错误的图像,通常也与查询图像在视觉或语义上具有相似性,说明共享表征捕捉到了有意义的语义结构。
- 该方法在未见类别上泛化良好,零样本检索性能优异,归因于共享表征是极小充分统计量。
- 该方法在图像到图像转换与跨域检索任务中也取得了优异结果,验证了其在 ZS-SBIR 之外的广泛适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。