[论文解读] ECCV Caption: Correcting False Negatives by Collecting Machine-and-Human-verified Image-Caption Associations for MS-COCO
本文提出了 ECCV Caption 数据集,通过在机器-人工协同(MITL)标注流程中使用五种多样化的图像-文本匹配(ITM)模型,纠正了 MS-COCO 中的假阴性问题,实现了机器与人工共同验证的图像-标题关联。该数据集相比 MS-COCO,图像到标题的正样本增加了 3.6 倍,标题到图像的正样本增加了 8.5 倍。作者主张采用 mAP@R 而非 Recall@K 作为更具有信息量的评估指标,结果显示,使用新基准时,模型排名发生显著变化。
Image-Text matching (ITM) is a common task for evaluating the quality of Vision and Language (VL) models. However, existing ITM benchmarks have a significant limitation. They have many missing correspondences, originating from the data construction process itself. For example, a caption is only matched with one image although the caption can be matched with other similar images and vice versa. To correct the massive false negatives, we construct the Extended COCO Validation (ECCV) Caption dataset by supplying the missing associations with machine and human annotators. We employ five state-of-the-art ITM models with diverse properties for our annotation process. Our dataset provides x3.6 positive image-to-caption associations and x8.5 caption-to-image associations compared to the original MS-COCO. We also propose to use an informative ranking-based metric mAP@R, rather than the popular Recall@K (R@K). We re-evaluate the existing 25 VL models on existing and proposed benchmarks. Our findings are that the existing benchmarks, such as COCO 1K R@K, COCO 5K R@K, CxC R@1 are highly correlated with each other, while the rankings change when we shift to the ECCV mAP@R. Lastly, we delve into the effect of the bias introduced by the choice of machine annotator. Source code and dataset are available at https://github.com/naver-ai/eccv-caption
研究动机与目标
- 为解决现有视觉-语言(VL)基准(如 MS-COCO)中广泛存在的假阴性问题,即尽管存在多个有效关联,但仅标注一个图像-标题对为正样本。
- 通过构建包含更广泛正样本对应关系的更全面、更准确的基准,提升 VL 模型评估的公平性与信息量。
- 研究机器标注器在 MITL 标注流程中引入的偏差,并通过多模型选择策略提出缓解方法。
- 证明在纠正假阴性后,mAP@R 指标比 Recall@K 更具信息量,尤其在正样本被修正后更为显著。
提出的方法
- 作者采用基于五种最先进 ITM 模型(CLIP、ViLT、VSRN、PVSE 和 PCME)的机器-人工协同(MITL)标注流程,预先筛选候选图像-标题对供人工验证,将标注负担从 760 亿对减少至约 130 万对。
- 人工标注者验证机器筛选对的相关性,确保高质量标注的同时保持可扩展性。
- 最终的 ECCV Caption 数据集包含 1,261 个图像查询,平均每个图像有 17.9 个正向标题(vs. MS-COCO 中的 5 个),以及 1,332 个标题查询,平均每个标题对应 8.5 个正向图像(vs. MS-COCO 中的 1 个)。
- 作者提出 mAP@R 作为优于 Recall@K 的评估指标,因其更能捕捉排序质量,并对噪声或部分正确的标注更具鲁棒性。
- 为评估模型偏差,定义模型偏差度量 $\mathcal{B}_{\Theta}$ 为模型在其子集 MITL 模型上的得分与在完整多模型参考数据集上的得分之间的平均绝对差值。
- 通过分析自偏差与非自偏差,表明仅使用单一模型进行 MITL 会导致显著偏差,而使用多个模型可降低整体偏差,且随着模型数量增加,偏差总体下降。
实验结果
研究问题
- RQ1通过人工验证、机器建议的图像-标题关联纠正 MS-COCO 中的假阴性,对视觉-语言模型评估有何影响?
- RQ2不同机器标注器在 MITL 标注流程中引入的偏差程度如何?这些偏差如何量化并缓解?
- RQ3在正样本被纠正的前提下,使用 mAP@R 作为评估指标是否能提供比 Recall@K 更可靠、更具信息量的模型排名?
- RQ4通过改变 MITL 流程中底层机器标注器,是否能任意改变 VL 模型的排名?这对基准公平性有何启示?
- RQ5在 MITL 流程中使用的机器标注器数量如何影响数据集的整体偏差与可靠性?
主要发现
- ECCV Caption 数据集相比原始 MS-COCO 数据集,图像到标题的正样本关联增加了 3.6 倍,标题到图像的正样本关联增加了 8.5 倍。
- 在新基准上使用 mAP@R 指标评估时,25 个预训练 VL 模型的排名发生显著变化,相较于传统的 Recall@K,表明以往基准可能掩盖了真实模型性能差异。
- 在 MITL 流程中仅使用单一机器标注器会引入显著偏差——模型偏差 $\mathcal{B}_{\Theta}$ 最高可达 9.5;而使用多个模型可降低该偏差,且整体偏差随模型数量增加而下降。
- 单个模型的自偏差较低(如 PVSE 为 0.1),但非自偏差显著更高(如 PVSE 为 11.8),表明模型性能更易受 MITL 流程中其他模型选择的影响。
- 尽管存在部分噪声标注(如错误物体、颜色或数量),mAP@R 仍比 Recall@K 更具鲁棒性,因其通过考虑排序质量而非仅 top-K 正确性,减轻了假阳性的影响。
- 本研究表明,机器标注器的选择对数据集质量与模型评估具有决定性影响,多模型 MITL 策略对于最小化偏差并确保公平基准至关重要。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。