[论文解读] Farewell to Mutual Information: Variational Distillation for Cross-Modal Person Re-Identification
本文提出变分自蒸馏(VSD),一种新颖的信息瓶颈方法,通过使用变分推断来解析优化表示学习,从而绕过互信息估计。VSD、变分交叉蒸馏(VCD)和变分互学习(VML)通过保留与任务相关的信息并消除视图特异性噪声,在跨模态行人重识别任务中实现了最先进性能,计算开销极低且理论基础坚实。
The Information Bottleneck (IB) provides an information theoretic principle for representation learning, by retaining all information relevant for predicting label while minimizing the redundancy. Though IB principle has been applied to a wide range of applications, its optimization remains a challenging problem which heavily relies on the accurate estimation of mutual information. In this paper, we present a new strategy, Variational Self-Distillation (VSD), which provides a scalable, flexible and analytic solution to essentially fitting the mutual information but without explicitly estimating it. Under rigorously theoretical guarantee, VSD enables the IB to grasp the intrinsic correlation between representation and label for supervised training. Furthermore, by extending VSD to multi-view learning, we introduce two other strategies, Variational Cross-Distillation (VCD) and Variational Mutual-Learning (VML), which significantly improve the robustness of representation to view-changes by eliminating view-specific and task-irrelevant information. To verify our theoretically grounded strategies, we apply our approaches to cross-modal person Re-ID, and conduct extensive experiments, where the superior performance against state-of-the-art methods are demonstrated. Our intriguing findings highlight the need to rethink the way to estimate mutual
研究动机与目标
- 为解决信息瓶颈(IB)优化中长期存在的互信息估计挑战,该挑战限制了表示学习的可扩展性和鲁棒性。
- 开发一种理论基础坚实、可扩展且解析的替代方法,用于IB模型中显式互信息估计。
- 通过在不依赖强先验的前提下消除视图特异性和与任务无关的信息,提升多模态学习中对视图变化的鲁棒性。
- 通过联合优化表示的充分性与一致性,实现跨模态行人重识别的卓越性能。
- 证明在使用基于变分推断的蒸馏时,显式互信息估计并非有效表示学习的必要条件。
提出的方法
- 提出变分自蒸馏(VSD),利用变分推断解析重构IB目标,避免直接进行互信息估计。
- 采用自蒸馏机制,使模型能够从自身表示中重建与标签相关的信息,从而确保与任务相关特征的保留。
- 通过变分交叉蒸馏(VCD)将VSD扩展至多视图学习,通过最小化视图特异性信息来对齐不同视图的表示。
- 引入变分互学习(VML),通过对称地促进模态间相互知识迁移,增强表示的一致性。
- 设计基于VSD、VCD和VML的训练损失,实现联合优化并相互受益,从而提升表示的充分性与一致性。
- 采用轻量化IB架构,仅包含三个全连接层,与标准模型相比计算开销极低(推理时间仅增加1.09倍,额外参数为3.04M)。
实验结果
研究问题
- RQ1在表示学习中,是否可以不进行显式估计而有效优化互信息?
- RQ2变分推断能否为信息瓶颈框架中的互信息估计提供一种可扩展且解析的替代方案?
- RQ3在多模态学习中,如何在不依赖强先验的前提下提升表示对视图变化的鲁棒性?
- RQ4自蒸馏与交叉蒸馏机制在跨模态行人重识别中,能在多大程度上增强特征的充分性与一致性?
- RQ5消除视图特异性信息是否能提升跨模态匹配任务中的泛化能力与性能?
主要发现
- 所提出的VSD方法在跨模态行人重识别基准上实现了最先进性能,优于现有SOTA方法。
- VSD使模型能够保留充分的任务相关信息,同时有效抑制与任务无关的干扰项,如嵌入空间的t-SNE可视化所示。
- VSD、VCD与VML的联合使用使不同模态间的表示高度一致,嵌入空间中呈现出清晰且紧凑的聚类,而传统IB方法则因表示混杂重叠而表现不佳。
- 该方法计算开销极低(训练时间仅增加1.09倍,额外参数为3.04M),显著低于使用互信息估计器的传统IB方法(训练时间增加1.26倍,额外参数达35.71M)。
- t-SNE投影结果证实,VSD与VCD能有效消除视图特异性信息,使同一身份在不同模态下形成对齐且分明的聚类。
- 如图7所示,互信息拟合过程表明,表示中的预测信息在训练过程中逐渐逼近标签的真实信息,验证了该方法的理论收敛性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。