[论文解读] Mean Box Pooling: A Rich Image Representation and Output Embedding for the Visual Madlibs Task
本文提出均值框池化(Mean Box Pooling),一种通过聚合大量重叠的目标提议的CNN特征来增强视觉理解能力的丰富图像表征方法。结合一种新颖的文本嵌入损失函数,该损失函数直接在输出空间中优化预测答案嵌入与真实答案嵌入之间的相似性,该方法在Visual Madlibs基准测试中取得了最先进性能,超越了以往的CNN+LSTM和nCCA方法。
We present Mean Box Pooling, a novel visual representation that pools over CNN representations of a large number, highly overlapping object proposals. We show that such representation together with nCCA, a successful multimodal embedding technique, achieves state-of-the-art performance on the Visual Madlibs task. Moreover, inspired by the nCCA's objective function, we extend classical CNN+LSTM approach to train the network by directly maximizing the similarity between the internal representation of the deep learning architecture and candidate answers. Again, such approach achieves a significant improvement over the prior work that also uses CNN+LSTM approach on Visual Madlibs.
研究动机与目标
- 通过利用密集且高度重叠的目标提议集合,改进Visual Madlibs任务的视觉表征。
- 通过将相似性计算直接整合到训练过程中,解决CNN+LSTM模型中事后答案选择的局限性。
- 证明端到端优化嵌入相似性可提升多选视觉推理任务的性能。
- 表明对大量高度重叠的目标提议进行池化可增强特征丰富度并提升模型性能。
提出的方法
- 均值框池化通过聚合大量高度重叠的目标提议的CNN特征,构建一种丰富且多尺度的图像表征。
- 该方法使用归一化典型相关分析(nCCA)将图像和文本表征嵌入到共享空间中,以实现联合优化。
- 提出一种新颖的文本嵌入损失,训练LSTM以最大化网络输出嵌入与真实答案嵌入之间的余弦相似度。
- 该方法通过将事后答案比较替换为在嵌入空间中直接优化相似性,扩展了CNN+LSTM架构。
- 模型通过对比损失进行端到端训练,以促使预测嵌入与正确候选答案对齐。
- 该方法在Visual Madlibs数据集上进行评估,其在简单和困难任务变体上均优于先前的最先进模型。
实验结果
研究问题
- RQ1对大量高度重叠的目标提议进行池化是否能改善视觉推理任务的视觉表征?
- RQ2与事后比较方法相比,直接优化预测答案与真实答案之间嵌入相似性是否能带来更好的性能?
- RQ3与使用真实边界框或稀疏提议相比,均值框池化在性能和鲁棒性方面表现如何?
- RQ4将nCCA与CNN+LSTM架构结合,是否能超越标准微调,在多选视觉推理任务中实现性能提升?
主要发现
- 使用大量重叠提议的均值框池化在Visual Madlibs基准测试中实现了最先进性能,优于使用真实边界框的方法。
- 所提出的文本嵌入损失显著提升了CNN+LSTM基线模型,在简单任务上达到54.7%的准确率,在困难任务上达到49.3%,超过原始CNN+LSTM方法。
- 模型从更高的提议密度中获益,随着提议数量的增加,性能持续提升,即使在高度重叠的情况下亦是如此。
- 端到端嵌入相似性训练方法优于先前工作中采用的事后比较策略,证明了与多选目标更紧密集成的优势。
- 在简单任务上,该方法相比原始CNN+LSTM提升了2.1个百分点(54.7% vs. 47.7%),在困难任务上提升了2.8个百分点(49.3% vs. 41.7%)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。