[论文解读] Exploring Uncertainty Measures for Image-Caption Embedding-and-Retrieval Task
本文提出两种不确定性度量——基于回归的特征不确定性(feature uncertainty)和基于分类的后验不确定性(posterior uncertainty)——用于图像字幕检索系统。结果表明,后验不确定性在不同数据集上均能持续提升检索性能与可靠性评估;而特征不确定性在分布外或模糊查询情况下可靠性有限。
With the wide development of black-box machine learning algorithms, particularly deep neural network (DNN), the practical demand for the reliability assessment is rapidly rising. On the basis of the concept that `Bayesian deep learning knows what it does not know,' the uncertainty of DNN outputs has been investigated as a reliability measure for the classification and regression tasks. However, in the image-caption retrieval task, well-known samples are not always easy-to-retrieve samples. This study investigates two aspects of image-caption embedding-and-retrieval systems. On one hand, we quantify feature uncertainty by considering image-caption embedding as a regression task, and use it for model averaging, which can improve the retrieval performance. On the other hand, we further quantify posterior uncertainty by considering the retrieval as a classification task, and use it as a reliability measure, which can greatly improve the retrieval performance by rejecting uncertain queries. The consistent performance of two uncertainty measures is observed with different datasets (MS COCO and Flickr30k), different deep learning architectures (dropout and batch normalization), and different similarity functions.
研究动机与目标
- 为解决图像字幕嵌入与检索系统中缺乏可靠性评估的问题,特别是在数据分布偏移或模糊查询情况下。
- 探究贝叶斯深度学习中的不确定性量化是否能提升检索性能并检测不可靠预测。
- 比较两种不确定性度量——特征不确定性(回归视角)与后验不确定性(分类视角)——在多样化场景下的有效性。
- 评估这些不确定性度量在不同数据集(MS COCO、Flickr30k、RecipeQA)、模型架构(VGG19、VSE++)和相似度函数下的鲁棒性。
提出的方法
- 将图像字幕嵌入视为回归任务,通过蒙特卡洛 dropout 估计特征不确定性,利用多次前向传播的模型平均来降低方差。
- 将检索任务重新表述为分类问题,通过候选字幕间预测相似度分布的熵来计算后验不确定性。
- 对后验不确定性应用温度缩放,以提升校准性与可靠性估计。
- 在 MS COCO 上使用 VGG19 训练并评估 VSE++ 模型,随后在 Flickr30k 和 RecipeQA 上测试以评估泛化能力与数据集偏移下的鲁棒性。
- 训练阶段使用基于排名的损失函数(如对比损失),但在推理阶段通过后验分布估计不确定性。
- 使用检索指标(如 R@1、R@5、R@10)评估不确定性度量,并比较启用或禁用基于不确定性的过滤或模型平均后的性能差异。
实验结果
研究问题
- RQ1能否通过模型平均,利用嵌入回归得到的特征不确定性来提升检索性能?
- RQ2能否通过基于分类的相似度评分得到的后验不确定性,作为图像字幕检索中可靠的可靠性度量?
- RQ3这些不确定性度量在不同数据集上的表现如何,特别是在协变量偏移(如从 MS COCO 到 Flickr30k 或 RecipeQA)情况下?
- RQ4为何尽管嵌入的方差较高,特征不确定性仍无法检测分布外或模糊查询?
- RQ5架构选择(如 dropout、批归一化)和相似度函数如何影响不确定性估计的可靠性?
主要发现
- 后验不确定性通过过滤不可靠查询,显著提升了检索性能,尤其在模糊或分布外情况下表现突出。
- 特征不确定性通过多次蒙特卡洛前向传播的模型平均提升了检索准确率,但无法可靠反映预测置信度。
- 后验不确定性在 Flickr30k 和特别是 RecipeQA 数据集上的值显著高于 MS COCO,表明其对数据集偏移与分布偏移具有敏感性。
- 尽管在 Flickr30k 上性能显著下降,特征不确定性在 MS COCO、Flickr30k 和 RecipeQA 上的分布相似,表明其在分布外检测中可靠性差。
- 定性分析显示,后验不确定性能捕捉到相似目标之间的混淆(如棒球挥棒动作),而特征不确定性反映的是图像局部复杂度,而非语义模糊性。
- 后验不确定性度量在不同深度学习架构(如 VGG19 与 VSE++)和相似度函数下均表现稳健,展现出良好的泛化能力与强大的可靠性评估性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。