Skip to main content
QUICK REVIEW

[论文解读] An Algorithm for Routing Capsules in All Domains

Franz A. Heinsen|arXiv (Cornell University)|Nov 2, 2019
Topic Modeling参考文献 16被引用 5
一句话总结

本文提出了一种新颖的、通用的胶囊网络路由算法,在EM框架中引入一种新的D-Step,用于计算输入胶囊使用的净收益与成本,从而在视觉和语言任务中均实现最先进性能,且超参数调优极少。该方法在smallNORB数据集上以更少的参数和训练轮数达到99.1%的准确率,在SST-2/R上使用冻结的BERT嵌入实现95.6%的准确率,证明了其在不同领域的通用适用性。

ABSTRACT

Building on recent work on capsule networks, we propose a new, general-purpose form of "routing by agreement" that activates output capsules in a layer as a function of their net benefit to use and net cost to ignore input capsules from earlier layers. To illustrate the usefulness of our routing algorithm, we present two capsule networks that apply it in different domains: vision and language. The first network achieves new state-of-the-art accuracy of 99.1% on the smallNORB visual recognition task with fewer parameters and an order of magnitude less training than previous capsule models, and we find evidence that it learns to perform a form of "reverse graphics." The second network achieves new state-of-the-art accuracies on the root sentences of the Stanford Sentiment Treebank: 58.5% on fine-grained and 95.6% on binary labels with a single-task model that routes frozen embeddings from a pretrained transformer as capsules. In both domains, we train with the same regime. Code is available at https://github.com/glassroom/heinsen_routing along with replication instructions.

研究动机与目标

  • 开发一种适用于视觉和自然语言处理等多样化领域的一般性胶囊网络路由算法。
  • 通过在EM路由循环中引入新的D-Step,同时建模使用输入胶囊的收益与忽略它们的成本,提升胶囊网络性能。
  • 支持可变大小输入处理——这对NLP中的序列建模至关重要——同时保持低参数量和高准确率。
  • 证明相同的路由算法、训练方案和模型架构可在无需领域特定调优的情况下,在多个领域实现最先进结果。
  • 通过端到端训练,探索胶囊网络在学习结构化表征(如视觉中的“逆向图形”和语言中的树状结构)方面的潜力。

提出的方法

  • 路由算法采用期望最大化(EM)框架,其中输出胶囊通过迭代最大化来自所使用输入胶囊的投票概率来更新。
  • 在E-Step与M-Step之间引入一种新型D-Step,基于净收益(使用)减去净成本(忽略)来计算每个输出胶囊对每个输入胶囊的使用或忽略比例。
  • 通过将净收益与净成本之差输入逻辑斯蒂函数来计算输出胶囊激活值,实现稳定且可微的优化。
  • 通过将每个上下文嵌入视为具有上下文依赖输出的胶囊,支持可变大小输入(如上下文嵌入序列)。
  • 该方法支持可变大小输出,并使用经过逻辑斯蒂函数处理的预激活分数,提升了数值稳定性与下游目标的灵活性。
  • 路由机制可视为一种注意力机制,其中输出胶囊通过竞争获取输入胶囊的投票,每个输出根据一致性与成本-收益权衡,关注输入的不同子集。

实验结果

研究问题

  • RQ1是否能够通过统一的胶囊网络路由算法,在单一训练方案下实现视觉与自然语言处理任务的最先进性能?
  • RQ2同时建模使用输入胶囊的收益与忽略它们的成本,如何提升胶囊网络的路由性能与泛化能力?
  • RQ3胶囊网络在无需显式监督的情况下,通过端到端训练,能在多大程度上学习结构化表征(如姿态或句法树结构)?
  • RQ4所提出的路由算法是否能有效处理可变大小输入(如嵌入序列),同时保持低参数量与高准确率?
  • RQ5该路由机制是否能实现‘逆向图形’学习——即无需为该任务显式设计架构或损失函数,也能从输入和标签中重建姿态?

主要发现

  • 采用所提路由算法的胶囊网络在smallNORB视觉识别任务上达到99.1%的测试准确率,优于以往最先进结果,仅使用272,000个参数和50个训练轮次。
  • smallNORB模型泛化能力优于以往胶囊模型,无需通过裁剪平均进行数据增强,且使用全分辨率96×96立体图像。
  • 模型表现出学习‘逆向图形’的证据——即在未显式优化此任务的情况下,从像素数据和标签中重建姿态,可视化结果已证实此现象。
  • 在SST-2/R情感分类任务上,模型以单任务架构实现95.6%的准确率,创下单模型性能新纪录。
  • 在SST-5/R上,模型实现58.5%的准确率,同样为新纪录,仅使用140,000个参数,并将冻结的GPT-2-large嵌入作为胶囊进行路由。
  • 相同的路由算法、训练方案与模型架构在两个领域均实现最先进结果,证明了该算法的通用性与可组合性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。