Skip to main content
QUICK REVIEW

[论文解读] Single-Modal Entropy based Active Learning for Visual Question Answering

Dong-Jin Kim, Jae-Won Cho|arXiv (Cornell University)|Oct 21, 2021
Multimodal Machine Learning Applications参考文献 60被引用 5
一句话总结

本文提出了一种新颖的视觉问答(VQA)主动学习方法——单模态熵度量(SMEM),该方法利用仅图像或仅问题单模态分支的不确定性来选择最具信息量的样本。通过结合基于熵的采样与自蒸馏技术,使单模态与多模态预测对齐,SMEM在VQA-v2上将标注成本降低了约30%,同时在多个数据集(包括VizWiz和VQA-CP2)上超越了当前最先进基线方法。

ABSTRACT

Constructing a large-scale labeled dataset in the real world, especially for high-level tasks (eg, Visual Question Answering), can be expensive and time-consuming. In addition, with the ever-growing amounts of data and architecture complexity, Active Learning has become an important aspect of computer vision research. In this work, we address Active Learning in the multi-modal setting of Visual Question Answering (VQA). In light of the multi-modal inputs, image and question, we propose a novel method for effective sample acquisition through the use of ad hoc single-modal branches for each input to leverage its information. Our mutual information based sample acquisition strategy Single-Modal Entropic Measure (SMEM) in addition to our self-distillation technique enables the sample acquisitor to exploit all present modalities and find the most informative samples. Our novel idea is simple to implement, cost-efficient, and readily adaptable to other multi-modal tasks. We confirm our findings on various VQA datasets through state-of-the-art performance by comparing to existing Active Learning baselines.

研究动机与目标

  • 通过减少所需标注数量,解决大规模VQA数据集标注成本高、效率低的问题。
  • 克服现有主动学习方法在多模态设置中的局限性,因为大多数先前工作集中于单模态输入。
  • 开发一种有效利用图像与问题模态之间互信息的方法,以识别最具信息量的标注样本。
  • 通过引入一种简单、成本效益高且可扩展的框架,提升VQA中的样本获取效率,该框架可适用于其他多模态任务。
  • 证明使用SMEM进行选择性采样可超越在完整数据集上训练的模型性能,从而挑战‘更多数据总是带来更好性能’的假设。

提出的方法

  • 提出单模态熵度量(SMEM),一种基于不确定性的采样策略,通过计算专用单模态分支(仅图像或仅问题)的预测结果熵值,识别最具信息量的样本。
  • 设计一个多分支模型架构,包含一个使用图像和问题输入的‘主干’分支,以及分别处理每种模态的独立单模态分支。
  • 应用自蒸馏技术,将单模态分支的输出与主多模态分支对齐,提升单模态预测结果的可靠性,以支持采样决策。
  • 将单模态与多模态预测之间的差异作为互信息的代理指标,其中高差异性表示高信息增益。
  • 将采样标准形式化为单模态预测的熵值,实现在无需额外推理步骤的前提下高效且基于不确定性的选择。
  • 通过将每种模态(如动作识别中的RGB与深度)视为独立输入流,将该框架适配至非VQA任务,证明其在NTU RGB+D上的泛化能力。

实验结果

研究问题

  • RQ1能否通过单模态预测计算出的熵值有效识别多模态VQA中最具信息量的样本?
  • RQ2单模态分支与多模态分支之间的自蒸馏是否能提升不确定性估计的可靠性,从而增强主动学习性能?
  • RQ3SMEM在多样化VQA数据集上是否能在准确率与标注效率方面超越现有主动学习基线方法?
  • RQ4所提出的方法是否可泛化至VQA以外的其他多模态任务(如动作识别)?
  • RQ5使用SMEM进行选择性采样是否能实现超越在完整数据集上训练的模型性能?

主要发现

  • SMEM在VQA-v2上将标注工作量减少了约30%,同时达到最先进性能,显著优于随机采样和大多数基线方法。
  • 在具有挑战性的VizWiz数据集上,SMEM在大多数采样阶段均取得最佳性能,甚至超越近期最先进方法(如VAAL和SRAAL)。
  • 在VQA-CP2上,SMEM超越所有基线方法,包括熵值和随机采样方法,并且在仅使用40万张样本子集训练时,准确率高于完整数据集基线(39.91%)。
  • 该方法在非VQA任务中也表现出良好的泛化能力,在NTU RGB+D动作识别数据集的所有采样阶段均取得优异表现。
  • 自蒸馏显著提升了单模态预测的一致性,从而增强了不确定性估计的可靠性,并带来了更优的样本获取效果。
  • 结果表明,高质量的选择性数据采样可超越在全量数据集上训练的模型,挑战了关于VQA中数据规模决定性能的传统假设。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。