[论文解读] Learning Visual Question Answering by Bootstrapping Hard Attention
本文提出了一种用于视觉问答(VQA)的新颖硬注意力机制,该机制基于L2-范数大小选择显著视觉特征,实现无需通过选择过程进行梯度反向传播的高效且精确的推理。该方法在CLEVR数据集上实现了最先进性能,优于或匹配软注意力模型,同时在非局部关系网络中表现出更优的计算效率。
Attention mechanisms in biological perception are thought to select subsets of perceptual information for more sophisticated processing which would be prohibitive to perform on all sensory inputs. In computer vision, however, there has been relatively little exploration of hard attention, where some information is selectively ignored, in spite of the success of soft attention, where information is re-weighted and aggregated, but never filtered out. Here, we introduce a new approach for hard attention and find it achieves very competitive performance on a recently-released visual question answering datasets, equalling and in some cases surpassing similar soft attention architectures while entirely ignoring some features. Even though the hard attention mechanism is thought to be non-differentiable, we found that the feature magnitudes correlate with semantic relevance, and provide a useful signal for our mechanism's attentional selection criterion. Because hard attention selects important features of the input information, it can also be more efficient than analogous soft attention mechanisms. This is especially important for recent approaches that use non-local pairwise operations, whereby computational and memory costs are quadratic in the size of the set of features.
研究动机与目标
- 为解决深度学习中硬注意力机制的训练挑战,因其非可微性而难以通过反向传播进行优化。
- 探究特征幅值(L2-范数)是否与语义相关性相关,从而为硬注意力选择提供一种简单且可微的启发式方法。
- 开发一种计算高效的VQA架构,仅选择最相关的视觉特征进行处理,降低非局部操作中的二次方复杂度。
- 证明基于特征范数的硬注意力可与复杂视觉推理任务中的软注意力机制性能相当或更优。
- 提供可解释的注意力掩码,突出显示对最终答案有贡献的语义上有意义图像区域。
提出的方法
- 硬注意力网络(HAN)选择L2-范数值最高的固定数量视觉特征向量进行进一步处理,将范数用作语义相关性的代理指标。
- 自适应硬注意力网络(AdaHAN)基于输入相关的阈值动态选择可变数量的高范数特征,提升灵活性。
- 该方法利用了L2-范数较大的特征向量通常对应于语义显著图像区域(如与问题相关的物体或属性)的观察结果。
- 该架构将硬注意力整合到标准VQA流程中,通过多模态融合将CNN提取的图像特征与问题嵌入相结合,并通过最终分类器输出结果。
- 模型在注意力和关系推理之前,使用1×1卷积和批量归一化以稳定训练并提升特征表示质量。
- 该方法应用于非局部关系网络(如关系网络,RN),通过限制处理的特征对数量,降低计算成本。
实验结果
研究问题
- RQ1CNN特征的L2-范数大小能否作为硬注意力机制中选择语义相关视觉特征的可靠、可微信号?
- RQ2基于特征范数的硬注意力机制在视觉问答任务中是否能与软注意力模型实现相当的性能?
- RQ3此类硬注意力机制是否能降低非局部关系网络中的计算与内存开销,后者随输入特征数量呈二次方增长?
- RQ4该注意力机制是否具备可解释性,所选特征是否对应于视觉上显著且语义上有意义的图像区域?
- RQ5当与复杂的关系推理模块(如关系网络)结合时,硬注意力机制是否仍保持有效性?
主要发现
- HAN+RN++模型在CLEVR数据集上达到98.8%的整体准确率,优于基线SAN*模型(76.6%),并匹配或超越最先进模型。
- HAN+RN++模型在'比较属性'和'查询属性'问题类型上达到99.6%的准确率,表明其在复杂关系推理任务中表现强劲。
- HAN+RN+模型达到96.9%的整体准确率,优于基于软注意力的SAN*模型(76.6%)和基线RN模型(95.5%)。
- 该方法生成了可解释的注意力掩码,所选特征始终定位到语义相关的图像区域,如问题中提及的物体或属性。
- 硬注意力机制通过限制处理的特征对数量,降低了非局部关系网络中的计算成本,使其比完整成对计算更高效。
- 该方法在无需特殊训练程序或注意力选择的显式监督的情况下,仅依赖标准L2正则化和基于范数的启发式方法,即实现了具有竞争力的性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。