[论文解读] Creating Something from Nothing: Unsupervised Knowledge Distillation for Cross-Modal Hashing
本文提出了一种无监督知识蒸馏(UKD)方法用于跨模态哈希,其中由无监督教师模型指导有监督学生模型,以在无需实例级标签的情况下提升检索性能。通过利用教师模型的相似性矩阵生成伪监督信号,UKD在MIRFlickr和NUS-WIDE数据集上实现了最先进性能,显著优于现有无监督方法。
In recent years, cross-modal hashing (CMH) has attracted increasing attentions, mainly because its potential ability of mapping contents from different modalities, especially in vision and language, into the same space, so that it becomes efficient in cross-modal data retrieval. There are two main frameworks for CMH, differing from each other in whether semantic supervision is required. Compared to the unsupervised methods, the supervised methods often enjoy more accurate results, but require much heavier labors in data annotation. In this paper, we propose a novel approach that enables guiding a supervised method using outputs produced by an unsupervised method. Specifically, we make use of teacher-student optimization for propagating knowledge. Experiments are performed on two popular CMH benchmarks, i.e., the MIRFlickr and NUS-WIDE datasets. Our approach outperforms all existing unsupervised methods by a large margin.
研究动机与目标
- 解决有监督跨模态哈希(CMH)方法中高昂的标注成本,同时保持高检索准确率。
- 探究无监督模型是否可通过知识蒸馏有效指导有监督模型进行CMH。
- 开发一种方法,利用无监督模型中丰富的相关性信息来增强有监督学习。
- 证明高质量的无监督模型相似性矩阵可作为有监督训练的有效伪监督信号。
- 验证所提方法在不同主干网络和特征提取器上的泛化性与鲁棒性。
提出的方法
- 提出一种两阶段框架:首先训练一个无监督CMH模型(教师)以生成高质量的特征表示和相似性矩阵。
- 利用教师模型的相似性矩阵(基于特征距离计算)作为伪监督信号,指导有监督学生模型。
- 通过最小化学生模型预测相似性与教师模型计算出的相似性矩阵之间的KL散度,实现知识蒸馏。
- 学生模型同时使用蒸馏损失和标准对比损失进行训练,以保持语义对齐。
- 该方法模块化且灵活,支持教师与学生模型互换,包括不同位长和架构。
- 在MIRFlickr和NUS-WIDE上使用mAP和top-K精度进行评估,并对选定的相关对及教师模型强度进行消融研究。
实验结果
研究问题
- RQ1无监督CMH模型能否有效生成伪监督信号以提升有监督CMH模型的性能?
- RQ2教师模型相似性矩阵的质量如何影响蒸馏过程的性能?
- RQ3与纯无监督基线相比,从无监督教师模型蒸馏知识是否能提升检索准确率?
- RQ4性能对蒸馏过程中选择的相关对数量有多敏感?
- RQ5所提方法是否能在不同特征提取器和模型架构间实现泛化?
主要发现
- UKD在MIRFlickr和NUS-WIDE两个基准测试中显著优于所有现有无监督CMH方法,实现了最先进mAP结果。
- 使用128位UGACH模型作为教师时,UKD在MIRFlickr上实现了16位mAP 68.9%,较基线UGACH模型提升超过5个百分点。
- 即使使用较弱的16位教师模型,UKD仍能实现稳定的准确率增益,尽管低于使用更强教师模型时的提升。
- 随着选择的相关对数量增加,性能提升,但当包含过多低质量相关对时,性能趋于饱和或略有下降,表明数量与质量之间存在权衡。
- UKD-SS(使用更强学生模型)优于UKD-US(使用较弱学生模型),证实该方法受益于更强的学生模型容量。
- 定性分析表明,UKD在复杂查询(如语义丰富的图文检索)中仍能有效检索相关结果。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。