[论文解读] How to Design Sample and Computationally Efficient VQA Models
本文提出 DePe,一种样本效率和计算效率均高的视觉问答(VQA)模型,采用基于对象的场景图表示视觉信息,使用概率程序表示语言,实现端到端可微分训练与软逻辑推理。DePe 在保持最先进准确率的同时,显著提升了样本效率与计算效率,尤其在低数据设置下表现突出。
In multi-modal reasoning tasks, such as visual question answering (VQA), there have been many modeling and training paradigms tested. Previous models propose different methods for the vision and language tasks, but which ones perform the best while being sample and computationally efficient? Based on our experiments, we find that representing the text as probabilistic programs and images as object-level scene graphs best satisfy these desiderata. We extend existing models to leverage these soft programs and scene graphs to train on question answer pairs in an end-to-end manner. Empirical results demonstrate that this differentiable end-to-end program executor is able to maintain state-of-the-art accuracy while being sample and computationally efficient.
研究动机与目标
- 识别视觉、语言与推理在视觉问答中最具样本效率与计算效率的组件组合。
- 探究多模态推理中神经网络与符号模型之间的神经符号权衡。
- 设计一个统一的视觉问答模型,整合最高效的组件,在不损失准确率的前提下提升整体效率。
- 在低数据监督条件下评估所提模型的性能,尤其关注样本效率。
提出的方法
- 将图像表示为基于对象的场景图,以捕捉结构化的视觉关系,提升可解释性与效率。
- 将语言问题表示为概率程序(软程序),以实现对符号操作的可微分推理。
- 使用软逻辑模块进行推理,支持在视觉与语言表示上对程序进行可微分执行。
- 使用标准反向传播端到端训练整个模型,避免使用强化学习或离散采样。
- 通过一个可微分程序执行器,联合处理场景图与软程序,实现视觉、语言与推理组件的集成。
- 在低数据规模下(0.1% 与 1%)对物体特征(O)与程序特征(FP)施加直接监督,以提升样本效率。
实验结果
研究问题
- RQ1在视觉问答中,哪一种视觉、语言与推理组件的组合能实现样本效率与计算效率的最佳平衡?
- RQ2与强化学习或基于反演的优化相比,端到端可微分训练在效率与准确率方面表现如何?
- RQ3概率程序与基于对象的场景图能否协同提升模型性能,同时降低数据与计算需求?
- RQ4当仅使用 0.1% 的标注数据时,模型在低数据设置下的表现如何?
主要发现
- 在完整 VQA 数据集(100% 数据)上,DePe 达到 99.0% 的准确率,在仅 0.1% 监督数据下仍达到 98.0%,在低数据条件下优于大多数基线模型。
- 在 10% 数据下,DePe 达到 98.0% 的准确率,显著优于 NS-VQA(92.1%)与 TbD(54.2%),展现出卓越的样本效率。
- DePe 的计算效率显著高于 NS-CL,后者使用 REINFORCE 算法,收敛需大量迭代。
- Stack-NMN 与 Prob-NMN 在低数据条件下表现强劲,但当对物体与程序特征施加直接监督时,仍被 DePe 超越。
- 模型在保持最先进准确率的同时,减少了对昂贵的离散采样或反演的依赖,实现更快收敛。
- DePe 的端到端可微分训练框架实现了稳定优化,避免了如 NS-VQA 等离散推理模型常见的高方差问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。