Skip to main content
QUICK REVIEW

[论文解读] Compact Trilinear Interaction for Visual Question Answering

Tuong Do, Thanh-Toan Do|arXiv (Cornell University)|Sep 26, 2019
Multimodal Machine Learning Applications参考文献 42被引用 13
一句话总结

该论文提出了一种紧凑的三线性交互(CTI)模型,通过PARALIND张量分解降低计算复杂度,在视觉问答(VQA)任务中联合学习图像、问题和答案表征之间的高层关联。该方法在TDIUC、VQA-2.0和Visual7W数据集上达到最先进性能,在使用基于目标的特征时,Visual7W上的准确率达到72.3%,并引入知识蒸馏技术,使三线性模型能够无需答案即可用于自由形式VQA推理。

ABSTRACT

In Visual Question Answering (VQA), answers have a great correlation with question meaning and visual contents. Thus, to selectively utilize image, question and answer information, we propose a novel trilinear interaction model which simultaneously learns high level associations between these three inputs. In addition, to overcome the interaction complexity, we introduce a multimodal tensor-based PARALIND decomposition which efficiently parameterizes trilinear interaction between the three inputs. Moreover, knowledge distillation is first time applied in Free-form Opened-ended VQA. It is not only for reducing the computational cost and required memory but also for transferring knowledge from trilinear interaction model to bilinear interaction model. The extensive experiments on benchmarking datasets TDIUC, VQA-2.0, and Visual7W show that the proposed compact trilinear interaction model achieves state-of-the-art results when using a single model on all three datasets.

研究动机与目标

  • 为解决现有VQA方法中缺乏对图像、问题和答案三者之间显式联合建模的问题,这些方法将答案视为被动的分类目标。
  • 克服VQA中三模态之间完整三线性交互带来的高计算与内存开销。
  • 实现在自由形式开放式VQA中有效应用三线性交互,其中推理阶段无法获取答案。
  • 通过同时显式建模图像、问题和答案三者之间的高层关联,提升VQA性能。

提出的方法

  • 提出一种紧凑三线性交互(CTI)层,通过三线性形式建模图像、问题和答案特征之间的交互:$ z^T = (\mathcal{T} \times_1 \text{vec}(V)) \times_2 \text{vec}(Q) \times_3 \text{vec}(A) $,其中$\mathcal{T}$为可学习张量。
  • 应用PARALIND张量分解,将三线性交互张量分解为更小的低秩分量,将参数量从约2.2万亿减少至约3369万。
  • 引入基于低秩矩阵$W_{z_v}$、$W_{z_q}$和$W_{z_a}$的参数分解策略,高效近似三线性交互。
  • 利用通过$\mathcal{M} = \sum_{r=1}^R \llbracket \mathcal{G}_r; V^T W_{v_r}, Q^T W_{q_r} \rrbracket $计算出的注意力图$\mathcal{M}$,动态加权图像与问题区域之间的交互。
  • 应用知识蒸馏,将训练时使用答案的三线性模型的知识迁移至无需答案的双线性模型中,实现在自由形式VQA中的部署。
  • 采用两阶段训练流程:首先在包含全部三个输入的情况下训练完整的CTI模型,随后将其知识蒸馏至双线性模型,用于测试数据的推理。

实验结果

研究问题

  • RQ1与被动分类答案相比,显式联合建模图像、问题和答案表征是否能提升VQA性能?
  • RQ2PARALIND张量分解是否能有效降低三线性交互的计算与内存开销,同时不损失性能?
  • RQ3知识蒸馏是否能成功地将训练阶段需要答案的三线性模型的知识迁移至推理阶段无需答案的双线性模型中?
  • RQ4所提出的紧凑三线性交互是否在多个基准VQA数据集上优于现有最先进方法?

主要发现

  • 所提出的CTI模型在TDIUC测试集上达到69.3%的准确率,优于先前最先进方法如BAN2(67.5%)和STL(68.2%)。
  • 在VQA-2.0验证集上,CTI模型达到69.3%的top-1准确率,优于MCB(62.2%)和fPMC(66.0%)。
  • 在Visual7W测试集上,使用基于目标的特征(Bottom-up特征)时,CTI模型达到72.3%的准确率,较先前SOTA方法STL(68.2%)提升4.1个百分点。
  • PARALIND分解将三线性交互中的参数量从约2.2万亿减少至3369万,压缩率约为65,280。
  • 知识蒸馏方法有效实现了将三线性模型知识迁移至双线性模型中,使其适用于推理阶段无答案的自由形式VQA。
  • 该紧凑三线性交互方法在BAN的基础上进行了泛化,将其双线性注意力机制扩展至包含答案特征,并实现了三者模态的联合学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。