Skip to main content
QUICK REVIEW

[论文解读] Probabilistic Embeddings for Cross-Modal Retrieval

Sanghyuk Chun, Seong Joon Oh|arXiv (Cornell University)|Jan 13, 2021
Multimodal Machine Learning Applications参考文献 58被引用 5
一句话总结

本文提出概率交叉模态嵌入(PCME),一种将图像和文本描述表示为共享嵌入空间中概率分布的方法,以建模图像-文本对中固有的多对多对应关系。通过学习具有不确定性的嵌入表示,PCME在确定性基线方法上实现了更优的检索性能,并支持可解释的不确定性估计以及对嵌入的集合运算。

ABSTRACT

Cross-modal retrieval methods build a common representation space for samples from multiple modalities, typically from the vision and the language domains. For images and their captions, the multiplicity of the correspondences makes the task particularly challenging. Given an image (respectively a caption), there are multiple captions (respectively images) that equally make sense. In this paper, we argue that deterministic functions are not sufficiently powerful to capture such one-to-many correspondences. Instead, we propose to use Probabilistic Cross-Modal Embedding (PCME), where samples from the different modalities are represented as probabilistic distributions in the common embedding space. Since common benchmarks such as COCO suffer from non-exhaustive annotations for cross-modal matches, we propose to additionally evaluate retrieval on the CUB dataset, a smaller yet clean database where all possible image-caption pairs are annotated. We extensively ablate PCME and demonstrate that it not only improves the retrieval performance over its deterministic counterpart but also provides uncertainty estimates that render the embeddings more interpretable. Code is available at https://github.com/naver-ai/pcme

研究动机与目标

  • 为解决图像-文本检索中固有的多对多对应关系挑战,即单张图像可对应多个有效描述,反之亦然。
  • 克服确定性嵌入函数无法建模跨模态匹配多样性的局限。
  • 通过CUB数据集的详尽标注构建更清晰的评估基准,解决COCO数据集中标注不完整的问题。
  • 通过不确定性估计实现可解释的嵌入表示,支持对模糊性与失败可能性的分析。
  • 证明概率嵌入支持集合代数运算,且其结果与语义关系一致。

提出的方法

  • 在共享嵌入空间中将图像和文本描述表示为多变量高斯分布,由均值向量和方差向量参数化。
  • 使用带困难负样本挖掘的对比损失进行模型训练,其中嵌入损失基于均值向量计算,不确定性通过KL散度进行正则化。
  • 将标准差分量的几何平均值用作实例级别的不确定性得分,以量化查询中的模糊性。
  • 通过图像和文本的擦除数据增强方法,研究不确定性与缺失视觉或文本信息的相关性。
  • 使用t-SNE将嵌入可视化为二维,以分析不同语义类别下的空间聚类与分布行为。
  • 对输入数据执行集合代数操作(如混合、擦除),并观察嵌入分布的相应变化,以验证语义一致性。

实验结果

研究问题

  • RQ1概率嵌入能否有效建模图像-描述对中常见的多对多关系?
  • RQ2从概率嵌入中估计的不确定性是否与输入数据的实际模糊性相关?
  • RQ3在标准和更清晰的基准上,PCME的性能与确定性及多表示基线相比如何?
  • RQ4对嵌入执行的集合运算是否能反映有意义的语义关系,如交集或包含?
  • RQ5不确定性得分是否能预测检索难度或失败可能性?

主要发现

  • 在COCO 1k上,PCME在R@1上达到45.0,R@5上达到68.8,优于确定性基线,并与PVSE和VSRN基线相当或更优。
  • 模型性能随不确定性增加而下降,证实高不确定性与检索难度相关。
  • 标准差分量的不确定性估计与图像中擦除像素比例及描述中擦除词的比例呈正相关,验证了其对输入模糊性的敏感性。
  • 二维可视化显示,如“这只鸟有<unk> ...”等通用描述占据中心区域,覆盖多个子类别,表明其对语义泛化的分布建模能力。
  • 集合代数操作(如混合或擦除)产生的嵌入反映了交集与包含关系,证明了概率空间中的语义一致性。
  • 仅使用均值向量(mu-only)的PCME已优于确定性模型,但完整的概率建模进一步提升了鲁棒性与可解释性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。