Skip to main content
QUICK REVIEW

[论文解读] TAB-VCR: Tags and Attributes based Visual Commonsense Reasoning Baselines

Jingxiang Lin, Unnat Jain|arXiv (Cornell University)|Oct 31, 2019
Multimodal Machine Learning Applications参考文献 109被引用 4
一句话总结

本文提出TAB-VCR,一种简单而高效的视觉常识推理模型,通过利用物体属性和增强的文本到图像定位能力提升性能。通过用轻量级架构替代复杂的注意力机制,并整合属性感知的视觉特征与额外的物体检测,TAB-VCR在参数量减少50%的情况下实现最先进性能,在VCR问答、解释和整体任务上分别超越先前工作5.3%、4.4%和6.5%。

ABSTRACT

Reasoning is an important ability that we learn from a very early age. Yet, reasoning is extremely hard for algorithms. Despite impressive recent progress that has been reported on tasks that necessitate reasoning, such as visual question answering and visual dialog, models often exploit biases in datasets. To develop models with better reasoning abilities, recently, the new visual commonsense reasoning (VCR) task has been introduced. Not only do models have to answer questions, but also do they have to provide a reason for the given answer. The proposed baseline achieved compelling results, leveraging a meticulously designed model composed of LSTM modules and attention nets. Here we show that a much simpler model obtained by ablating and pruning the existing intricate baseline can perform better with half the number of trainable parameters. By associating visual features with attribute information and better text to image grounding, we obtain further improvements for our simpler & effective baseline, TAB-VCR. We show that this approach results in a 5.3%, 4.4% and 6.5% absolute improvement over the previous state-of-the-art on question answering, answer justification and holistic VCR.

研究动机与目标

  • 为解决复杂、易产生偏差的视觉常识推理模型的局限性,开发一种更简单、更鲁棒的基线模型。
  • 通过整合视觉属性并扩展原始VCR标注之外的物体定位,提升模型性能。
  • 证明仅使用最小化架构并结合增强的视觉-语言对齐,即可超越结构复杂的模型,且参数量显著减少。
  • 识别并修正VCR数据集中缺失的物体检测,以克服准确推理的障碍。

提出的方法

  • 模型使用微调后的预训练图像CNN进行属性预测,以提取视觉特征,从而在标准图像分类基础上增强物体表征能力。
  • 提出一种新颖的定位机制,结合词性标注与Wu-Palmer相似度,将文本中的名词短语与视觉物体关联,包括原始VCR标注中未包含的物体。
  • 通过重新应用CNN检测并标注图像中此前未标注的名词(如“cart”、“coats”),将物体检测扩展至未标记对象。
  • 采用简化的前馈网络替代先前最先进模型中的LSTM与注意力模块,降低模型复杂度,同时保持性能。
  • 模型对图像特征、预测属性和扩展的物体标签进行联合推理,生成答案与推理过程。
  • 消融实验验证了属性学习与扩展定位的有效性,即使在减小模型规模时仍能获得性能增益。

实验结果

研究问题

  • RQ1当结合属性与定位增强时,更简单的模型架构是否能在视觉常识推理任务中超越复杂的注意力机制模型?
  • RQ2在VCR基准上,整合视觉属性并检测此前未标注的物体,对推理性能有何影响?
  • RQ3VCR数据集中存在的数据偏差与不完整的物体标注在多大程度上限制了模型性能?如何缓解这些问题?
  • RQ4通过剪枝与消融减少模型复杂度,是否能提升视觉推理任务中的泛化能力与鲁棒性?

主要发现

  • 与先前最先进模型相比,TAB-VCR在VCR问答子任务上实现5.3%的绝对性能提升。
  • 在答案解释子任务上提升4.4%,表明其具备更强的推理能力。
  • 在整体VCR任务(评估整体推理性能)上实现6.5%的绝对增益。
  • 尽管参数量不足先前最先进模型的一半(15M vs. 30M),TAB-VCR仍表现更优。
  • 消融实验确认,属性学习与扩展的物体定位是性能提升的关键因素。
  • 模型在具有更丰富文本定位的样本上表现更优,表明图像与语言之间更强的对齐可提升推理准确性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。