[论文解读] Visual Referring Expression Recognition: What Do Systems Actually Learn?
本文研究了当前最先进(SOTA)的指代表达识别(RER)模型是否真正理解语言结构,还是仅依赖数据集偏差。通过引入忽略或部分使用指代表达的简单神经筛检模型,作者发现模型在不使用语言输入的情况下仍能达到84.2%的top-2精确率,表明其性能可能源于数据中的浅层相关性,而非对语言的深层理解。
We present an empirical analysis of the state-of-the-art systems for referring expression recognition -- the task of identifying the object in an image referred to by a natural language expression -- with the goal of gaining insight into how these systems reason about language and vision. Surprisingly, we find strong evidence that even sophisticated and linguistically-motivated models for this task may ignore the linguistic structure, instead relying on shallow correlations introduced by unintended biases in the data selection and annotation process. For example, we show that a system trained and tested on the input image $ extit{without the input referring expression}$ can achieve a precision of 71.2% in top-2 predictions. Furthermore, a system that predicts only the object category given the input can achieve a precision of 84.2% in top-2 predictions. These surprisingly positive results for what should be deficient prediction scenarios suggest that careful analysis of what our models are learning -- and further, how our data is constructed -- is critical as we seek to make substantive progress on grounded language tasks.
研究动机与目标
- 探究当前最先进RER模型是否真正利用语言结构,还是仅利用数据集偏差。
- 评估RER模型在指代表达扰动(如词序打乱、词类移除)下的鲁棒性。
- 开发简单的基线模型(神经筛检模型),揭示复杂模型可能利用的数据中的浅层相关性。
- 强调在基于视觉的语言任务中,数据集与模型分析的重要性,以确保进展源于真正的理解,而非虚假相关性。
提出的方法
- 提出两种简单的神经筛检模型:Sieve I 忽略指代表达,仅根据类别频率筛选物体;Sieve II 从指代表达中预测物体类别。
- 采用结合Sieve I与Sieve II的流水线,将候选物体集合减少至2个或更少。
- 实施扰动实验:打乱词序、仅保留名词和形容词、完全移除指代表达。
- 在Google-Ref数据集上进行训练与评估,使用precision@k指标,并与CMN和LSTM+CNN-MIL等SOTA模型进行比较。
- 使用Faster R-CNN特征和GloVe嵌入;通过SGD和L2归一化训练联合表示。
- 通过文本特征与框特征的逐元素相乘生成联合表示,随后使用Sigmoid评分进行目标定位。
实验结果
研究问题
- RQ1当前最先进RER模型在多大程度上依赖语言结构,而非浅层视觉或类别相关性?
- RQ2RER模型对词序打乱或词类受限等扰动的鲁棒性如何?
- RQ3能否通过忽略或部分使用指代表达的简单模型实现高性能,表明数据集中存在可利用的偏差?
- RQ4SOTA模型中正确预测的多少比例可归因于物体类别频率,而非语言推理?
- RQ5仅通过不使用指代表达的简单神经筛检模型流水线,能在多大程度上复现复杂模型的性能?
主要发现
- 在不使用指代表达的模型中,top-2预测的精确率达到71.2%,表明其强烈依赖视觉和类别线索。
- 仅从指代表达中预测物体类别的模型在top-2预测中达到84.2%的精确率,表明类别级信息本身已极具预测力。
- 结合神经筛检模型I(类别过滤)与Sieve II(类别预测)的流水线在top-2预测中达到84.2%的精确率,在top-3预测中达到95.3%的精确率。
- 即使在词序打乱或仅保留名词和形容词的情况下,SOTA模型仍保持高性能,表明其对句法结构的依赖极低。
- 结果表明,许多SOTA RER模型可能学习的是数据中的浅层相关性,而非真正的语言-视觉对齐。
- 本研究表明,仅通过物体类别统计和图像特征即可实现显著性能,引发了对当前评估指标有效性和数据集偏差的担忧。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。