Skip to main content
QUICK REVIEW

[论文解读] MoVie: Revisiting Modulated Convolutions for Visual Counting and Beyond

Duy-Kien Nguyen, Vedanuj Goswami|arXiv (Cornell University)|Apr 24, 2020
Video Surveillance and Tracking Methods参考文献 62被引用 15
一句话总结

MoVie 提出了一种新颖且高效的视觉计数方法,通过使用查询调制的卷积瓶颈,在单次前向传播中隐式地对图像特征进行推理。该方法在 HowMany-QA 和 TallyQA 等计数基准上达到最先进性能,在 COCO 物体计数任务上优于先前方法,并通过增强通用 VQA 模型以应对 '数量' 类问题,在 2020 年 VQA 挑战赛中获得第一名。

ABSTRACT

This paper focuses on visual counting, which aims to predict the number of occurrences given a natural image and a query (e.g. a question or a category). Unlike most prior works that use explicit, symbolic models which can be computationally expensive and limited in generalization, we propose a simple and effective alternative by revisiting modulated convolutions that fuse the query and the image locally. Following the design of residual bottleneck, we call our method MoVie, short for Modulated conVolutional bottlenecks. Notably, MoVie reasons implicitly and holistically and only needs a single forward-pass during inference. Nevertheless, MoVie showcases strong performance for counting: 1) advancing the state-of-the-art on counting-specific VQA tasks while being more efficient; 2) outperforming prior-art on difficult benchmarks like COCO for common object counting; 3) helped us secure the first place of 2020 VQA challenge when integrated as a module for 'number' related questions in generic VQA models. Finally, we show evidence that modulated convolutions such as MoVie can serve as a general mechanism for reasoning tasks beyond counting.

研究动机与目标

  • 开发一种通用、高效的视觉推理模块,避免显式的符号计数和计算密集型推理。
  • 通过调制卷积在局部融合图像与查询特征,提升 VQA 任务中的视觉计数性能。
  • 证明调制卷积可作为通用机制,超越计数任务,在多种视觉推理任务中增强模型推理能力。
  • 将 MoVie 以极低计算开销集成到现有 VQA 架构中,显著提升 '数量' 类问题的准确率。

提出的方法

  • MoVie 使用残差瓶颈模块,其中每个模块由查询嵌入调制,实现图像与查询特征的局部融合。
  • 该方法在特征图上仅进行一次前向传播,实现高效推理,无需迭代或符号推理。
  • 使用查询表示调制卷积的通道权重,动态根据查询上下文调整特征图。
  • 通过将 MoVie 的输出与标准 VQA 特征融合,将其集成到 VQA 模型中,实现答案的联合预测。
  • 在 VQA 数据集上使用标准交叉熵损失进行端到端训练,参数增加极少。
  • 采用消融实验与可视化技术分析 MoVie 的贡献,包括基于相似性的归因方法,用于衡量其在不同问题类型中的影响。

实验结果

研究问题

  • RQ1调制卷积能否有效应用于自然图像计数任务,在无需显式符号推理的情况下实现优异性能?
  • RQ2在计数专用和通用 VQA 基准上,MoVie 相较于现有方法在准确率与效率方面表现如何?
  • RQ3MoVie 在通用 VQA 模型中对 '数量' 类问题的性能提升程度如何?
  • RQ4MoVie 是否能泛化到计数以外的其他视觉推理任务,如逻辑推理或空间推理?
  • RQ5MoVie 在推理过程中主要贡献于哪个阶段?其与 VQA 模型中标准全局融合相比表现如何?

主要发现

  • MoVie 在 HowMany-QA 和 TallyQA 上达到最先进性能,准确率更高且比先前的符号计数方法更高效。
  • 在 COCO 数据集上,MoVie 显著优于先前方法在常见物体计数任务上的表现,展现出强大的泛化能力。
  • 当集成到 MCAN 和 Pythia 模型中时,MoVie 将 VQA 2.0 测试开发集上 '数量' 类问题的准确率分别从 55.68% 提升至 57.05%,从 45.98% 提升至 53.25%。
  • MoVie 在 2020 年 VQA 挑战赛中获得第一名,主要得益于其在 '数量' 相关问题上的出色表现。
  • 可视化结果表明,MoVie 对 '有多少人' 和 '有多少' 等与计数相关的问题类型贡献最大,表明其在局部、查询特定推理中的有效性。
  • MoVie 对 '是/否' 和 '颜色' 相关问题也展现出可测量的性能提升,表明其推理能力超越计数任务,具备更广泛的应用潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。