Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot Transfer VQA Dataset

Yuanpeng Li, Yi Yang|arXiv (Cornell University)|Nov 2, 2018
Advanced Neural Network Applications参考文献 27被引用 6
一句话总结

本文提出了零样本迁移视觉问答(ZST-VQA)数据集,用于评估视觉问答(VQA)中零样本迁移学习的效果,其中某些词汇在训练时仅出现在一种模态中,但在测试时必须在另一种模态中进行预测。实验表明,现有的最先进VQA模型在此任务上表现失败,零样本答案任务的准确率为0%,揭示了由于模型训练中隐含偏差的存在,导致零样本泛化能力严重不足。

ABSTRACT

Acquiring a large vocabulary is an important aspect of human intelligence. Onecommon approach for human to populating vocabulary is to learn words duringreading or listening, and then use them in writing or speaking. This ability totransfer from input to output is natural for human, but it is difficult for machines.Human spontaneously performs this knowledge transfer in complicated multimodaltasks, such as Visual Question Answering (VQA). In order to approach human-levelArtificial Intelligence, we hope to equip machines with such ability. Therefore, toaccelerate this research, we propose a newzero-shot transfer VQA(ZST-VQA)dataset by reorganizing the existing VQA v1.0 dataset in the way that duringtraining, some words appear only in one module (i.e. questions) but not in theother (i.e. answers). In this setting, an intelligent model should understand andlearn the concepts from one module (i.e. questions), and at test time, transfer themto the other (i.e. predict the concepts as answers). We conduct evaluation on thisnew dataset using three existing state-of-the-art VQA neural models. Experimentalresults show a significant drop in performance on this dataset, indicating existingmethods do not address the zero-shot transfer problem. Besides, our analysis findsthat this may be caused by the implicit bias learned during training.

研究动机与目标

  • 探究当前VQA模型是否能够实现问题与答案之间概念的零样本迁移。
  • 创建一个新的基准数据集,通过解耦输入与输出模态中词汇的出现,以隔离零样本迁移能力。
  • 揭示并分析现有VQA模型中阻碍零样本泛化的隐含偏差。
  • 评估现有最先进VQA模型在目标模态中对未见词汇的泛化能力。
  • 提供一种诊断工具,用于检测模型是否存在对输入输出的表面化记忆而非真正的组合理解。

提出的方法

  • 重新组织VQA v1.0数据集,创建两个任务:零样本答案(ZSA)和零样本问题(ZSQ),其中目标词汇仅在训练期间出现在一种模态中。
  • 仅使用训练数据为问题和答案构建独立的词汇表,确保零样本词汇在训练期间不出现于目标模态中。
  • 在新的ZST-VQA划分上,使用标准VQA模型(SAN、HieCoAtt等)和标准训练与推理协议进行实验。
  • 通过归一化得分直方图分析模型预测结果,检测模型对已知答案相较于零样本答案的隐含偏好。
  • 引入联合词汇表、共享词嵌入以及最终层的共享转置权重,以测试架构修改是否能提升零样本性能。
  • 通过消融实验比较标准模型与修改后版本,以隔离偏差和模态解耦的作用。

实验结果

研究问题

  • RQ1现有最先进VQA模型能否实现从问题到答案的零样本概念泛化?
  • RQ2现有VQA模型能否实现从答案到问题的零样本概念泛化?
  • RQ3当前VQA模型在零样本迁移任务上性能显著下降的原因是什么?
  • RQ4模型表征中的隐含偏差在多大程度上阻碍了零样本泛化?
  • RQ5如共享嵌入和无偏置最终层等架构修改,能否提升零样本迁移性能?

主要发现

  • 所有评估的最先进VQA模型在零样本答案(ZSA)任务上的准确率均为0%,表明其完全无法泛化未见的答案词汇。
  • 零样本问题(ZSQ)任务相比标准测试集表现出显著性能下降,尽管未降至零,表明从答案到问题的迁移部分存在但严重不足。
  • 模型分析显示存在隐含偏差:即使在测试阶段,零样本答案的预-softmax得分也持续低于已知答案。
  • 这种隐含偏差在正常任务和零样本测试任务中均保持不变,表明模型内部流形被训练为偏好已知类别。
  • 即使采用架构修改(如共享词嵌入和无偏置最终层),ZSA准确率仍为0%,证实偏差和模态解耦是核心问题。
  • 结果表明,当前VQA模型依赖于记忆化的输入-输出模式,而非真正的组合理解,揭示了零样本泛化能力的根本性缺陷。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。