[论文解读] Dual Gaussian-based Variational Subspace Disentanglement for Visible-Infrared Person Re-Identification
本文提出了一种基于双高斯分布的变分自编码器(DG-VAE),用于在可见光-红外行人重识别(VI-ReID)任务中解耦身份可区分特征(IDI)与身份模糊特征(IAI)。通过使用高斯混合模型先验建模IDI,并使用标准高斯先验建模IAI,结合三元组交换重建策略,该方法在两个基准数据集上实现了最先进性能,在SYSU-MM01数据集上mAP提升了13.05%,在RegDB数据集上提升了10.86%。
Visible-infrared person re-identification (VI-ReID) is a challenging and essential task in night-time intelligent surveillance systems. Except for the intra-modality variance that RGB-RGB person re-identification mainly overcomes, VI-ReID suffers from additional inter-modality variance caused by the inherent heterogeneous gap. To solve the problem, we present a carefully designed dual Gaussian-based variational auto-encoder (DG-VAE), which disentangles an identity-discriminable and an identity-ambiguous cross-modality feature subspace, following a mixture-of-Gaussians (MoG) prior and a standard Gaussian distribution prior, respectively. Disentangling cross-modality identity-discriminable features leads to more robust retrieval for VI-ReID. To achieve efficient optimization like conventional VAE, we theoretically derive two variational inference terms for the MoG prior under the supervised setting, which not only restricts the identity-discriminable subspace so that the model explicitly handles the cross-modality intra-identity variance, but also enables the MoG distribution to avoid posterior collapse. Furthermore, we propose a triplet swap reconstruction (TSR) strategy to promote the above disentangling process. Extensive experiments demonstrate that our method outperforms state-of-the-art methods on two VI-ReID datasets.
研究动机与目标
- 解决可见光-红外行人重识别(VI-ReID)中因可见光与红外模态之间固有的光谱差异而产生的跨模态差异问题。
- 克服标准VAE在跨模态设置下对身份内变化建模不足以及类间可分性差的局限性。
- 解耦身份可区分特征(IDI)与身份模糊特征(IAI),以提升模型鲁棒性与检索准确性。
- 在监督设置下,为高斯混合模型先验构建理论基础坚实的变分推断框架,防止后验坍塌。
- 提出三元组交换重建(TSR)策略,以增强解耦过程中的身份一致性与表示学习效果。
提出的方法
- 设计一种基于双高斯分布的VAE(DG-VAE),对身份可区分特征(IDI)使用高斯混合模型(MoG)先验,对身份模糊特征(IAI)使用标准高斯先验。
- MoG先验通过为每个身份分配独立的高斯分量,建模身份内变化,从而增强类间可分性。
- 在监督学习下推导MoG先验的两个变分推断项,以稳定训练过程并防止后验坍塌。
- 实施三元组交换重建(TSR)策略,通过交换三元组(锚点、正样本、负样本)的特征进行重建,以强制实现身份一致的特征学习。
- 对特征图而非原始图像进行重建,以降低计算成本并提升泛化能力,同时保持性能损失最小。
- 使用PatchGAN判别器评估重建的特征图,但在最终模型中未对判别器应用二元交叉熵损失。
实验结果
研究问题
- RQ1基于双高斯先验结构是否能有效解耦跨模态行人重识别中的身份可区分特征与身份模糊特征?
- RQ2与标准高斯先验相比,使用高斯混合模型先验建模IDI是否能显著提升类内紧凑性与类间分离性?
- RQ3所提出的三元组交换重建(TSR)策略在多大程度上提升了身份一致性与VI-ReID性能?
- RQ4为何在此解耦框架中,特征图重建比图像重建更有效且高效?
- RQ5所推导的MoG先验变分推断项如何防止后验坍塌,并提升监督设置下VI-ReID的解耦效率?
主要发现
- DG-VAE模型在SYSU-MM01数据集上的mAP相比基线模型提升了13.05%,表明其对跨模态差异具有强大鲁棒性。
- 在RegDB数据集上,该方法相比基线mAP提升了10.86%,证实其在处理具有挑战性的跨模态差异方面的有效性。
- MoG先验显著增强了特征解耦,表现为潜在空间中类间距离裕度更大,类内聚类更紧凑。
- 三元组交换重建(TSR)策略有效促进了身份一致的特征学习,从而在两个数据集上均提升了性能。
- 与原始图像重建相比,特征图重建使模型参数减少一半,FLOPs降低80%,同时保持了具有竞争力的性能。
- 所提出的基于MoG的变分推断项成功避免了后验坍塌,实现了更稳定的训练,并提升了解耦效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。