[论文解读] A New Evaluation Protocol and Benchmarking Results for Extendable Cross-media Retrieval
本文提出了一种用于可扩展跨模态检索的新评估协议,通过分离训练类与测试类,模拟现实世界中查询内容可能不匹配已知类别的场景。该协议揭示了现有方法在未见类别上的性能显著下降,表明传统基于分类的基线方法在标准设置下虽有效,但在可扩展条件下失效,凸显了跨模态检索中知识迁移能力的不足。
This paper proposes a new evaluation protocol for cross-media retrieval which better fits the real-word applications. Both image-text and text-image retrieval modes are considered. Traditionally, class labels in the training and testing sets are identical. That is, it is usually assumed that the query falls into some pre-defined classes. However, in practice, the content of a query image/text may vary extensively, and the retrieval system does not necessarily know in advance the class label of a query. Considering the inconsistency between the real-world applications and laboratory assumptions, we think that the existing protocol that works under identical train/test classes can be modified and improved. This work is dedicated to addressing this problem by considering the protocol under an extendable scenario, \ie, the training and testing classes do not overlap. We provide extensive benchmarking results obtained by the existing protocol and the proposed new protocol on several commonly used datasets. We demonstrate a noticeable performance drop when the testing classes are unseen during training. Additionally, a trivial solution, \ie, directly using the predicted class label for cross-media retrieval, is tested. We show that the trivial solution is very competitive in traditional non-extendable retrieval, but becomes less so under the new settings. The train/test split, evaluation code, and benchmarking results are publicly available on our website.
研究动机与目标
- 为弥合传统跨模态检索评估协议与现实世界应用之间的差距,后者中查询类别在训练时未知。
- 提出一种新的评估协议,通过分离训练与测试类别,实现可扩展检索设置下的评估。
- 在传统与新协议下对现有方法进行基准测试,揭示其在现实场景中的性能退化。
- 在两种协议下评估基于简单分类的解决方案的有效性,揭示其在可扩展设置下的局限性。
- 公开提供代码、数据划分与基准结果,以支持可复现性与未来研究。
提出的方法
- 提出一种新评估协议,强制要求训练集与测试集之间完全无类别重叠,以模拟现实世界的可扩展检索。
- 使用标准跨模态数据集(如 NUS-WIDE、Wikipedia),通过重构划分方式,确保训练集与测试集之间无类别重叠。
- 采用标准检索指标——平均精度均值(MAP)与累积匹配特性(CMC)——在两种协议下评估性能。
- 在新协议下测试实值表示与二值化表示方法(如 CCA、深度网络、哈希模型),以评估其泛化能力。
- 评估一种简单基线:利用分类器预测的类别标签指导检索,比较其在两种协议下的性能表现。
- 公开发布训练/测试划分、评估代码与基准结果,以支持可复现性与社区采纳。
实验结果
研究问题
- RQ1在跨模态检索中,当测试类别在训练阶段完全未见时,性能会如何退化?
- RQ2在传统与可扩展评估协议下,基于简单分类的检索解决方案的有效性如何?
- RQ3当训练集与测试集的类别分布完全不重叠时,标准跨模态模型的泛化能力如何?
- RQ4在新协议下,标准评估指标(MAP 与 CMC)在区分模型性能方面的表现有何差异?
- RQ5新协议对未来跨模态检索与知识迁移研究有何启示?
主要发现
- 在从非可扩展到可扩展检索设置的转换过程中,多种方法均观察到显著的性能下降,表明其对未见类别的泛化能力较差。
- 利用预测类别标签进行检索的简单解决方案在传统协议下表现具有竞争力,但在新协议下性能显著下降,凸显其在现实场景中的局限性。
- 当方法的 MAP 值相近时,CMC 曲线比 MAP 分数更具区分度,尤其在新协议下,凸显 CMC 在细粒度性能比较中的价值。
- 在新协议下,不同方法之间的性能差异显著缩小,表明当前模型在类别分布不重叠时难以实现有效的知识迁移。
- 基准测试结果表明,现有模型对类别特定监督依赖过强,且在类别标签的领域偏移下缺乏鲁棒性。
- 新协议揭示了当前跨模态检索系统的关键局限,呼吁未来研究聚焦于迁移学习与通用模型泛化能力的提升。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。