[论文解读] Deep Bayesian Active Learning for Multiple Correct Outputs
本文提出了一种新颖的主动学习框架,该框架在视觉-语义嵌入空间中估计不确定性,而非输出概率空间,从而克服了传统不确定性度量在存在多个正确答案的任务(如VQA)中的局限性。通过在这一结构化的语义空间中利用基于Dropout的贝叶斯不确定性,该方法在Visual Genome和VQA 2.0上分别实现了5倍和3倍的成本效率提升,同时减少了对同义表达的采样,并提高了样本效率。
Typical active learning strategies are designed for tasks, such as classification, with the assumption that the output space is mutually exclusive. The assumption that these tasks always have exactly one correct answer has resulted in the creation of numerous uncertainty-based measurements, such as entropy and least confidence, which operate over a model's outputs. Unfortunately, many real-world vision tasks, like visual question answering and image captioning, have multiple correct answers, causing these measurements to overestimate uncertainty and sometimes perform worse than a random sampling baseline. In this paper, we propose a new paradigm that estimates uncertainty in the model's internal hidden space instead of the model's output space. We specifically study a manifestation of this problem for visual question answer generation (VQA), where the aim is not to classify the correct answer but to produce a natural language answer, given an image and a question. Our method overcomes the paraphrastic nature of language. It requires a semantic space that structures the model's output concepts and that enables the usage of techniques like dropout-based Bayesian uncertainty. We build a visual-semantic space that embeds paraphrases close together for any existing VQA model. We empirically show state-of-art active learning results on the task of VQA on two datasets, being 5 times more cost-efficient on Visual Genome and 3 times more cost-efficient on VQA 2.0.
研究动机与目标
- 解决传统不确定性采样在存在多个正确答案的视觉-语言任务主动学习中的失效问题。
- 克服像VQA中模型产生的同义表达输出所导致的不确定性高估问题。
- 通过在结构化的视觉-语义嵌入空间中估计不确定性,提升主动学习中的样本效率。
- 通过在嵌入空间中使用蒙特卡洛Dropout实现序列生成任务的有效贝叶斯不确定性估计。
- 通过所提出的范式在VQA基准上实现最先进性能和成本效率。
提出的方法
- 构建一个视觉-语义嵌入空间,利用Visual Genome中的区域描述将答案的同义表达聚类得彼此接近。
- 在学习到的视觉-语义嵌入空间中应用基于蒙特卡洛Dropout的贝叶斯不确定性估计,而非输出词元空间。
- 引入去噪模块以优化嵌入表示,提升不确定性估计的准确性。
- 将多次前向传播在嵌入空间中的方差作为主动学习选择的不确定性度量。
- 将视觉-语义空间作为可学习损失集成到训练过程中,使其与现有不确定性函数兼容。
- 基于嵌入空间的方差进行不确定性采样,以选择最具信息量的样本进行标注。
实验结果
研究问题
- RQ1在视觉-语言任务的主动学习中,基于视觉-语义嵌入空间的不确定性估计是否优于传统的输出空间不确定性度量?
- RQ2与基线不确定性策略相比,所提出方法在多大程度上减少了对同义表达答案的采样?
- RQ3该方法在视觉-语言生成任务的主动学习中,对样本效率的提升程度如何?
- RQ4去噪模块与结构化嵌入空间是否增强了在存在多个正确输出时贝叶斯不确定性估计的鲁棒性?
- RQ5在不同问题类型(如“what”和“where”问题)下,该方法在所采样答案的新颖性和多样性方面表现如何?
主要发现
- 与随机采样和现有不确定性基线相比,该方法在Visual Genome数据集上实现了5倍更高的成本效率。
- 在VQA 2.0数据集上,该方法比基线主动学习策略高出3倍成本效率。
- 在“what”问题上,该方法采样了27%更多的新概念,表明其多样性更高且冗余更少。
- 该模型显著减少了对同义表达答案的采样,尤其在“where”问题中,对具有多个同义表达的长答案采样减少了25.3%。
- 消融实验证实,结合视觉-语义空间、贝叶斯不确定性与去噪模块可获得最佳性能,各组件均对鲁棒性提升有贡献。
- 即使使用标准不确定性度量,仅使用视觉-语义空间也能显著提升性能,表明其在结构化多正确输出任务输出空间方面具有普遍适用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。