Skip to main content
QUICK REVIEW

[论文解读] Prototype-based Aleatoric Uncertainty Quantification for Cross-modal Retrieval

Hao Li, Jingkuan Song|arXiv (Cornell University)|Sep 29, 2023
Multimodal Machine Learning Applications被引用 6
一句话总结

本文提出原型-based 频率不确定性量化(PAU),一种新颖的框架,用于量化由模糊数据(如快节奏视频和非详细文本)引起的跨模态检索中的不确定性。通过学习模态特定的原型,并利用狄利克雷分布建模证据的Dempster-Shafer理论,PAU提升了预测的可靠性,在MSR-VTT、MSVD、DiDeMo和MS-COCO数据集上实现了最先进性能,通过不确定性感知重排序实现了最高2.2%的R@1提升。

ABSTRACT

Cross-modal Retrieval methods build similarity relations between vision and language modalities by jointly learning a common representation space. However, the predictions are often unreliable due to the Aleatoric uncertainty, which is induced by low-quality data, e.g., corrupt images, fast-paced videos, and non-detailed texts. In this paper, we propose a novel Prototype-based Aleatoric Uncertainty Quantification (PAU) framework to provide trustworthy predictions by quantifying the uncertainty arisen from the inherent data ambiguity. Concretely, we first construct a set of various learnable prototypes for each modality to represent the entire semantics subspace. Then Dempster-Shafer Theory and Subjective Logic Theory are utilized to build an evidential theoretical framework by associating evidence with Dirichlet Distribution parameters. The PAU model induces accurate uncertainty and reliable predictions for cross-modal retrieval. Extensive experiments are performed on four major benchmark datasets of MSR-VTT, MSVD, DiDeMo, and MS-COCO, demonstrating the effectiveness of our method. The code is accessible at https://github.com/leolee99/PAU.

研究动机与目标

  • 解决跨模态检索中缺乏不确定性量化的问题,特别是针对低质量或模糊的数据(如快节奏视频和非详细文本)。
  • 识别并量化源于固有数据模糊性的频率不确定性,而非模型不确定性。
  • 通过不确定性感知重排序和损失函数,提供可信预测,提升检索可靠性。
  • 开发一种可泛化的框架,能够区分高熵模糊数据与均匀分布的低置信度预测。
  • 证明移除不确定样本可提升检索性能,验证框架检测不可靠数据的能力。

提出的方法

  • 为每种模态构建可学习原型,以表示语义子空间,每个原型对应一个独立的语义类别。
  • 将输入样本与跨模态原型之间的余弦相似度作为Dempster-Shafer理论(DST)框架中的证据质量。
  • 通过从证据质量推导出的狄利克雷分布参数建模不确定性,实现概率性不确定性估计。
  • 引入不确定性损失,训练模型对模糊数据分配更高不确定性;引入多样性损失,确保原型均匀覆盖语义空间。
  • 通过预测的不确定性得分应用重排序,以过滤或重新加权不确定预测,提升检索性能。
  • 利用信息熵和最大熵原理,证明超越标准熵的高级不确定性建模的必要性。

实验结果

研究问题

  • RQ1在存在模糊数据的情况下,不确定性量化能否提升跨模态检索预测的可靠性?
  • RQ2如何有效建模和量化由数据模糊性(如快节奏视频或非详细文本)引起的频率不确定性?
  • RQ3当识别并处理不确定样本时,所提出的PAU框架是否在检索准确性和鲁棒性方面优于基线模型?
  • RQ4移除高不确定性样本在多大程度上能提升检索性能?这是否验证了框架检测不可靠数据的能力?
  • RQ5PAU的不确定性得分能否用于重排序预测,并提升跨模态检索任务中的R@1性能?

主要发现

  • 在使用不确定性损失时,PAU框架在视频到文本检索中实现2.2%的R@1提升,在文本到视频检索中实现1.4%的R@1提升,证明其在提升预测可靠性方面的有效性。
  • 从MSR-VTT测试集中移除最不确定的600个样本后,文本到视频检索性能提升14.2分,视频到文本检索性能提升12.3分,证实PAU能正确识别高度不可靠的数据。
  • 当r=70时,在高不确定性子集上,PAU在文本到视频检索中比基线模型最高提升8.6分R@1,表明其在不确定性下仍能保持性能。
  • 基于不确定性的重排序策略即使应用于微调后的基线模型,也能提升R@1,表明其具备强大的泛化能力和实际应用价值。
  • 可视化结果证实,高不确定性描述(如“一个人正在解释某事”)和包含多个场景的视频(如场景不断变化)被PAU正确标记为模糊。
  • 消融实验表明,多样性损失至关重要,因为缺少该损失的模型无法均匀覆盖语义空间,导致不确定性量化质量下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。