Skip to main content
QUICK REVIEW

[论文解读] Visual Reasoning by Progressive Module Networks

Seung Wook Kim, Makarand Tapaswi|arXiv (Cornell University)|Jun 6, 2018
Explainable Artificial Intelligence (XAI)被引用 4
一句话总结

本文提出渐进式模块网络(PMN),一种可微分、组合式的框架,通过逐步从可重用的黑箱低级模块构建高级任务,来训练视觉推理模型。通过学习以软门控机制查询并组合现有模块的输出,PMN在视觉推理任务上实现了性能提升,通过显式推理轨迹增强了可解释性,并通过重用预训练技能避免灾难性遗忘,从而提高了数据效率。

ABSTRACT

Humans learn to solve tasks of increasing complexity by building on top of previously acquired knowledge. Typically, there exists a natural progression in the tasks that we learn - most do not require completely independent solutions, but can be broken down into simpler subtasks. We propose to represent a solver for each task as a neural module that calls existing modules (solvers for simpler tasks) in a functional program-like manner. Lower modules are a black box to the calling module, and communicate only via a query and an output. Thus, a module for a new task learns to query existing modules and composes their outputs in order to produce its own output. Our model effectively combines previous skill-sets, does not suffer from forgetting, and is fully differentiable. We test our model in learning a set of visual reasoning tasks, and demonstrate improved performances in all tasks by learning progressively. By evaluating the reasoning process using human judges, we show that our model is more interpretable than an attention-based baseline.

研究动机与目标

  • 解决传统多任务学习的局限性,即任务之间相互独立,无法共享知识。
  • 使神经网络能够通过组合更简单、预训练的模块来学习日益复杂的视觉推理任务。
  • 通过暴露所组合模块的查询与响应轨迹,使推理过程显式化,从而提升模型可解释性。
  • 通过重用先前学习到的模块,避免灾难性遗忘,减少数据需求,从而提升数据效率。

提出的方法

  • 每个任务表示为一个神经模块,通过软门控机制从低级模块查询并组合输出。
  • 模块仅通过查询和输出进行通信,将低级模块视为黑箱,从而支持模块化组合与重用。
  • 模型完全可微分,支持模块组合与通信参数的端到端训练。
  • 从所使用模块的序列生成基于规则的自然语言解释,支持人类对推理质量的评估。
  • 该框架支持选择性信息流,使父模块能够根据任务需求学习查询哪些子模块。
  • 架构设计通过重用预训练模块并仅学习模块间通信,防止灾难性遗忘。

实验结果

研究问题

  • RQ1神经网络能否通过组合更简单、预训练的模块来解决复杂的视觉推理任务?
  • RQ2与端到端训练相比,模块的渐进式组合是否能带来性能提升和数据效率的改善?
  • RQ3通过暴露模块查询与响应的序列,能否使推理过程更具可解释性?
  • RQ4在低数据环境下,模型表现如何?通过重用预训练组件,其性能是否得以保持?
  • RQ5在复杂推理任务中,模型能否在准确率和可解释性方面均优于基于注意力的基线模型?

主要发现

  • PMN在所有评估的视觉推理任务中均优于非组合式基线模型,包括VQA、计数、图像字幕生成和关系推理。
  • 人类评估者对PMN的推理解释评分显著高于基线模型,正确答案上高出1.38分,正确PMN答案与错误基线答案之间高出0.74分。
  • 在低数据环境下,当仅使用10%的训练数据时,PMN实现了最大4.01%的绝对准确率提升,表现出强大的数据效率。
  • 当使用25%或以上训练数据时,模块重用带来的性能增益稳定在约2%,表明知识迁移具有持续效益。
  • PMN的推理过程对错误更具鲁棒性:即使最终答案错误,推理步骤的局部正确性也使人类评分高于基线模型中错误的推理过程。
  • 模型通过模块组合能力,能够将复杂问题分解为子任务,例如先检测物体,再推理空间关系或属性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。