[论文解读] Quality Estimation for Image Captions Based on Large-scale Human Evaluations
本文提出了一种基于大规模人工判断的图像字幕质量评估(QE)框架,从 Open Images Dataset 中收集了约 60 万条二元评分,覆盖 6.5 万组图像-字幕对。该方法在该数据上训练多模态模型,以无参考字幕的方式预测字幕质量,在分布外数据上过滤低质量字幕时达到 0.84 的高 AUC,展现出强大的泛化能力与在提升可访问性方面的实际应用价值。
Automatic image captioning has improved significantly over the last few years, but the problem is far from being solved, with state of the art models still often producing low quality captions when used in the wild. In this paper, we focus on the task of Quality Estimation (QE) for image captions, which attempts to model the caption quality from a human perspective and without access to ground-truth references, so that it can be applied at prediction time to detect low-quality captions produced on previously unseen images. For this task, we develop a human evaluation process that collects coarse-grained caption annotations from crowdsourced users, which is then used to collect a large scale dataset spanning more than 600k caption quality ratings. We then carefully validate the quality of the collected ratings and establish baseline models for this new QE task. Finally, we further collect fine-grained caption quality annotations from trained raters, and use them to demonstrate that QE models trained over the coarse ratings can effectively detect and filter out low-quality image captions, thereby improving the user experience from captioning systems.
研究动机与目标
- 开发一种可扩展的人工评估流程,用于在无参考字幕的情况下收集粗粒度的字幕质量评分。
- 创建一个大规模、公开可用的数据集(Caption-Quality),包含约 60 万条针对图像字幕质量的二元人工评分。
- 建立质量评估基线模型,使其能够泛化到未见过的图像,并优于简单的图文相似度基线。
- 验证基于粗粒度评分训练的 QE 模型是否能有效检测并过滤低质量字幕,基于细粒度人工标注结果。
- 展示 QE 模型在实际部署中通过过滤低质量字幕提升用户体验的实用价值。
提出的方法
- 设计一种众包流程,标注者仅根据图像上下文对字幕进行‘好’或‘坏’的评分,不访问参考字幕。
- 从 Open Images Dataset 中收集约 60 万条二元质量评分,覆盖 16,000 幅唯一图像和 55,000 组唯一图像-字幕对。
- 使用双线性交互层融合图像与字幕特征,训练多模态神经网络进行质量评估。
- 利用大规模图文数据集(如 Conceptual Captions)进行多模态预训练,提升模型泛化能力。
- 使用精确率-召回率曲线和 AUC 分数评估 QE 模型在保留数据集上的表现,该数据集包含训练标注者提供的细粒度标注。
- 对 QE 分数应用阈值以过滤低质量字幕,评估基于专家标注者对正确性与有用性的多数意见。
实验结果
研究问题
- RQ1可扩展的人工评估流程是否能在无参考字幕的情况下,收集到一致且可靠的图像字幕质量信号?
- RQ2粗粒度二元评分中编码的质量信号是否可被神经网络模型学习,并泛化到分布外图像?
- RQ3在细粒度评估集上,基于粗粒度评分训练的 QE 模型是否能有效区分‘正确且有帮助’与‘错误或无帮助’的字幕?
- RQ4多模态预训练在该任务上如何提升质量评估模型的性能?
- RQ5QE 模型在多大程度上可通过过滤低质量输出,提升真实世界字幕生成系统的性能?
主要发现
- Caption-Quality 数据集包含稳定且一致的质量信号,通过可扩展的众包流程收集了约 60 万条人工评分,覆盖 65,000 组图像-字幕对。
- 表现最佳的 QE 模型在验证集上达到 0.72 的斯皮尔曼等级相关系数,在测试集上达到 0.70,显著优于图文相似度基线。
- 在大规模图文数据上进行预训练可提升 QE 模型性能,微调后的模型在外部评估集上 AUC 达到 0.84。
- 预训练并微调的双线性模型在召回率为 0.71 时达到 0.8 的精确率,相较于图文相似度基线,覆盖率提升了 3.4 倍。
- 基于粗粒度评分训练的 QE 模型成功泛化到分布外图像,即使在训练阶段未接触细粒度标注,也能有效过滤低质量字幕。
- 该数据集支持有效的下游应用,如字幕重排序与基于强化学习的字幕生成,其在外部评估中的实用性已得到验证。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。