[论文解读] Supervising the Transfer of Reasoning Patterns in VQA
本文提出了一种程序监督方法,通过在真实世界噪声视觉输入上训练的VQA模型中,将从完美(oracle)视觉输入上训练的模型所学习到的推理模式进行迁移。通过在损失函数中添加一个正则化项以预测推理程序,该方法提升了推理泛化能力,理论上降低了样本复杂度,并在GQA数据集上实现了最先进性能,尤其在分布外和尾部准确率集合上表现优异,即使训练数据有限。
Methods for Visual Question Anwering (VQA) are notorious for leveraging dataset biases rather than performing reasoning, hindering generalization. It has been recently shown that better reasoning patterns emerge in attention layers of a state-of-the-art VQA model when they are trained on perfect (oracle) visual inputs. This provides evidence that deep neural networks can learn to reason when training conditions are favorable enough. However, transferring this learned knowledge to deployable models is a challenge, as much of it is lost during the transfer. We propose a method for knowledge transfer based on a regularization term in our loss function, supervising the sequence of required reasoning operations. We provide a theoretical analysis based on PAC-learning, showing that such program prediction can lead to decreased sample complexity under mild hypotheses. We also demonstrate the effectiveness of this approach experimentally on the GQA dataset and show its complementarity to BERT-like self-supervised pre-training.
研究动机与目标
- 解决由于数据集偏差和视觉输入噪声导致的VQA模型泛化能力差的问题。
- 将从oracle(完美)视觉输入中学到的推理能力迁移到在真实世界噪声视觉表征上训练的模型中。
- 通过推理程序的结构化监督,降低视觉推理任务中的样本复杂度。
- 提升VQA中分布外和罕见答案类别上的性能。
- 展示与BERT类自监督预训练方法的互补性。
提出的方法
- 引入一个程序监督模块,在答案预测之外,增加一个辅助损失以预测推理程序(操作序列)。
- 在损失函数中使用正则化项,以在从干净输入到噪声输入的迁移过程中保持推理模式的一致性。
- 将复杂的推理函数分解为更简单、可学习的组件(模式选择器和各个模式函数),从而简化学习过程。
- 采用视觉-语言Transformer模型,使用来自Faster R-CNN或更精确的VinVL模型的视觉特征,以提升输入表征质量。
- 理论分析采用PAC-学习框架,证明在温和假设下,程序监督可降低样本复杂度。
- 在带有程序注释的GQA数据集上应用该方法,实现从oracle训练模型到真实世界部署的迁移。
实验结果
研究问题
- RQ1监督推理程序预测是否能提升从oracle输入到噪声真实世界输入在VQA中的推理模式迁移效果?
- RQ2程序监督是否如理论分析所示,能降低视觉推理任务中的样本复杂度?
- RQ3在分布内和分布外数据上,程序监督与标准预训练方法(如BERT)相比,在性能和鲁棒性方面如何?
- RQ4程序监督能否更好地利用改进的视觉输入表征(如更多目标提议或更优特征)?
- RQ5程序监督在多大程度上提升了VQA中罕见或尾部答案类别上的性能?
主要发现
- 所提方法在GQA测试-std集上达到63.0%的准确率,在未使用额外训练数据的方法中排名第二。
- 在GQA-OOD尾部集合上达到80.1%的准确率,为第二好结果,且参数量显著更少(26M对比SOTA模型的212M)。
- 仅使用0.1M张图像和1M句段,该方法优于使用5.7M张图像训练的模型(如OSCAR+VinVL),在GQA上达到64.7%准确率,数据量仅为后者的1/50。
- 程序监督使模型能更好地利用改进的视觉输入:将目标提议数从36增加到100时性能提升,而基线模型保持不变。
- 该方法在罕见答案(acc-tail)和常见答案(acc-head)上均提升泛化能力,表现出对分布偏移的鲁棒性。
- 理论分析证实,在温和假设下,程序监督可降低样本复杂度,支持其经验有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。