[论文解读] Adaptive Memory Networks
自适应记忆网络(AMN)通过基于输入问题中实体的相关性创建离散的记忆库,动态构建可变深度的记忆架构,实现基于选择性库访问的快速推理。该模型在bAbI任务上实现了最先进(SOTA)的准确率,同时通过仅检查部分实体,将推理时间最多减少87%,其核心是可微分的离散库控制器。
We present Adaptive Memory Networks (AMN) that processes input-question pairs to dynamically construct a network architecture optimized for lower inference times for Question Answering (QA) tasks. AMN processes the input story to extract entities and stores them in memory banks. Starting from a single bank, as the number of input entities increases, AMN learns to create new banks as the entropy in a single bank becomes too high. Hence, after processing an input-question(s) pair, the resulting network represents a hierarchical structure where entities are stored in different banks, distanced by question relevance. At inference, one or few banks are used, creating a tradeoff between accuracy and performance. AMN is enabled by dynamic networks that allow input dependent network creation and efficiency in dynamic mini-batching as well as our novel bank controller that allows learning discrete decision making with high accuracy. In our results, we demonstrate that AMN learns to create variable depth networks depending on task complexity and reduces inference times for QA tasks.
研究动机与目标
- 在不牺牲准确率的前提下,减少问答系统中的推理时间。
- 实现基于输入复杂度的动态架构创建的记忆网络端到端训练。
- 学习用于记忆库创建和实体路由的离散、可微分决策。
- 通过仅对相关记忆库进行解码,提升长上下文问答任务的效率。
- 通过将实体组织为语义一致且与问题相关的记忆库,提升可解释性。
提出的方法
- AMN处理输入故事以提取实体,并将它们存储在记忆库中,当单个库中的熵超过阈值时,库的数量会动态增加。
- 一种新颖的可微分库控制器使用重参数化技巧,对实体在各库中的放置做出离散决策,从而实现通过离散选择的反向传播。
- 实体根据其与输入问题的相关性被分组到库中,形成反映问题依赖的实体聚类的分层结构。
- 该模型采用动态网络架构,根据每个输入仅创建必要的库数量,从而在推理过程中减少计算量。
- AMN通过在多个问题间生成共享的记忆结构,支持多问题处理,避免了冗余的网络构建。
- 解码器在推理过程中仅访问最相关的库,从而在速度与准确率之间实现权衡。
实验结果
研究问题
- RQ1记忆网络是否能在推理时动态构建其架构以降低计算成本?
- RQ2如何使离散的记忆管理决策可微分,以实现端到端训练?
- RQ3自适应记忆组织在不降低准确率的前提下,能在多大程度上提升推理效率?
- RQ4该模型是否能泛化到复杂度和实体关系各异的多样化问答任务?
- RQ5记忆库数量与任务难度及实体相关性之间存在何种关联?
主要发现
- AMN通过仅检查部分实体,与标准记忆网络相比,将推理时间最多减少87%。
- 在bAbI 100-entities任务中,AMN创建了6个记忆库,但仅使用了总实体数的13%(比例为0.13),显著减少了计算量。
- 在多问题任务中,AMN保持了高效率,尽管输入复杂度增加,平均仅使用了38%的实体。
- AMN在全部20个bAbI任务上均实现了最先进性能,包括路径查找和计数等复杂推理任务。
- 当实体稀疏或高度相关时,模型学会仅创建一个记忆库,表明其具备有效的基于相关性的路由能力。
- AMN的可微分离散控制器使模型能够在无需课程学习的情况下实现稳定训练,而NTM则不具备此特性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。