[论文解读] Working Memory Networks: Augmenting Memory Networks with a Relational Reasoning Module
本文提出工作记忆网络(W-MemNN),一种将关系推理模块(来自关系网络,RNs)整合进分层注意力机制的记忆网络架构,将计算复杂度从 O(n²) 降低至 O(n),同时保持关系推理性能。该模型在联合训练的 bAbI-10k 基准上达到新的 SOTA 水平,平均误差低于 0.5%,且一个简单的双模型集成可解决全部 20 项任务。
During the last years, there has been a lot of interest in achieving some kind of complex reasoning using deep neural networks. To do that, models like Memory Networks (MemNNs) have combined external memory storages and attention mechanisms. These architectures, however, lack of more complex reasoning mechanisms that could allow, for instance, relational reasoning. Relation Networks (RNs), on the other hand, have shown outstanding results in relational reasoning tasks. Unfortunately, their computational cost grows quadratically with the number of memories, something prohibitive for larger problems. To solve these issues, we introduce the Working Memory Network, a MemNN architecture with a novel working memory storage and reasoning module. Our model retains the relational reasoning abilities of the RN while reducing its computational complexity from quadratic to linear. We tested our model on the text QA dataset bAbI and the visual QA dataset NLVR. In the jointly trained bAbI-10k, we set a new state-of-the-art, achieving a mean error of less than 0.5%. Moreover, a simple ensemble of two of our models solves all 20 tasks in the joint version of the benchmark.
研究动机与目标
- 为解决标准记忆网络(MemNNs)在复杂关系推理方面的不足,其仅依赖注意力机制检索信息,缺乏深层推理能力。
- 克服关系网络(RNs)的二次方计算成本问题,因其随记忆规模增大而性能急剧下降。
- 在保持效率与可解释性的同时,将关系推理集成至记忆网络框架中,利用注意力机制实现。
- 实现从原始输入语句端到端学习,无需依赖外部 NLP 工具,尤其适用于视觉问答任务。
- 证明结合记忆网络与关系推理的混合架构可在复杂推理基准上实现 SOTA 性能。
提出的方法
- 模型使用基于 GRU 的输入模块,将文本或视觉输入编码为向量表示,并存储于短期记忆存储中。
- 注意力控制器执行多跳注意力,关注相关记忆向量,并在每一步更新紧凑的工作记忆缓冲区。
- 关系推理模块处理工作记忆缓冲区中的内容,以线性时间方式实现实体间关系的推理。
- 注意力机制过滤无关信息,减少关系计算量,实现可扩展的推理。
- 在视觉问答任务中,采用加性注意力机制,通过将记忆向量与语句向量拼接后输入前馈网络,计算注意力权重。
- 该架构通过交叉熵损失进行端到端训练,推理通过多跳迭代中的注意力与推理步骤完成。
实验结果
研究问题
- RQ1能否在记忆网络架构中引入关系推理,以解决复杂推理任务,同时避免二次方计算成本?
- RQ2关系推理模块的集成对多跳推理基准(如 bAbI)的性能有何影响?
- RQ3所提模型在未进行任务特定微调的情况下,能在联合训练的 bAbI-10k 上达到多大程度的 SOTA 表现?
- RQ4模型能否仅使用原始输入语句完成视觉问答,而无需结构化语言预处理?
- RQ5所提架构是否在实现可扩展关系推理的同时,通过注意力权重保持可解释性?
主要发现
- W-MemNN 在联合训练的 bAbI-10k 基准上实现了低于 0.5% 的平均误差,创下新的 SOTA 记录。
- 一个简单的双 W-MemNN 模型集成成功解决了联合 bAbI-10k 基准中的全部 20 项任务,展现出强大的泛化能力。
- 在 NLVR 视觉问答数据集上,该模型性能与模块化神经网络相当,但无需依赖外部 NLP 工具进行输入处理。
- 墙钟时间测量显示,当处理 30 个记忆时,W-MemNN 相较于标准 RNs 实现了 20 倍的加速,单批次处理时间从 930 秒降至 50 秒。
- 定性分析确认,关系推理模块对需要关系推理的任务至关重要,注意力权重清晰突出了相关记忆交互。
- 与标准 RNs 的二次方缩放不同,该推理模块的计算复杂度随记忆数量呈线性增长,使其适用于更大规模问题。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。