Skip to main content
QUICK REVIEW

[论文解读] Capsules with Inverted Dot-Product Attention Routing

Yao-Hung Hubert Tsai, Nitish Srivastava|arXiv (Cornell University)|Feb 12, 2020
Advanced Neural Network Applications参考文献 16被引用 17
一句话总结

本文提出了一种用于胶囊网络的倒置点积注意力路由机制,该机制基于父胶囊姿态与子胶囊投票之间的一致性进行路由,采用倒置注意力机制,应用层归一化,并支持并行迭代路由。该方法在CIFAR-10上达到95.14%的准确率,在CIFAR-100上达到78.02%——与ResNet-18性能相当,但参数量仅为后者的1/4,证明了胶囊网络在复杂现实任务中的可行性。

ABSTRACT

We introduce a new routing algorithm for capsule networks, in which a child capsule is routed to a parent based only on agreement between the parent's state and the child's vote. The new mechanism 1) designs routing via inverted dot-product attention; 2) imposes Layer Normalization as normalization; and 3) replaces sequential iterative routing with concurrent iterative routing. When compared to previously proposed routing algorithms, our method improves performance on benchmark datasets such as CIFAR-10 and CIFAR-100, and it performs at-par with a powerful CNN (ResNet-18) with 4x fewer parameters. On a different task of recognizing digits from overlayed digit images, the proposed capsule model performs favorably against CNNs given the same number of layers and neurons per layer. We believe that our work raises the possibility of applying capsule networks to complex real-world tasks. Our code is publicly available at: https://github.com/apple/ml-capsules-inverted-attention-routing An alternative implementation is available at: https://github.com/yaohungt/Capsules-Inverted-Attention-Routing/blob/master/README.md

研究动机与目标

  • 解决现有胶囊路由算法在复杂数据集上可扩展性和性能方面的局限性。
  • 在不依赖大量参数的情况下,使胶囊网络能够与最先进CNN模型竞争。
  • 通过倒置注意力机制建模父胶囊与子胶囊之间的一致性,改进路由过程。
  • 通过引入归一化和并行推理,使胶囊网络能够扩展至真实世界任务。
  • 证明胶囊网络可被高效且准确地应用于复杂视觉识别任务。

提出的方法

  • 路由机制采用倒置点积注意力,其中低层胶囊根据父胶囊姿态与子胶囊投票之间的一致性,关注高层胶囊。
  • 路由概率通过父胶囊姿态与子胶囊投票之间的点积直接计算,取代传统迭代路由,实现更易并行化的过程。
  • 在胶囊通道上应用层归一化,以稳定训练并改善优化。
  • 模型在多个胶囊层上同时执行迭代推理,而非逐层进行,从而实现胶囊状态与路由概率的联合优化。
  • 胶囊姿态表示为矩阵(由向量重塑而成),在保持计算效率的同时实现更丰富的表征。
  • 架构整合了SOTA CNN主干网络与胶囊层,随后是卷积和全连接胶囊层,以实现分层特征学习。

实验结果

研究问题

  • RQ1倒置注意力机制是否能通过测量父胶囊与子胶囊之间的一致性,改善胶囊网络中的路由?
  • RQ2在准确率和效率方面,并行跨胶囊层的迭代路由是否优于顺序的逐层路由?
  • RQ3层归一化是否能稳定胶囊网络中矩阵结构姿态的训练并提升性能?
  • RQ4在参数量显著更少的情况下,该路由机制的胶囊网络能否在基准数据集上达到或超越ResNet-18等强CNN模型的性能?
  • RQ5胶囊网络能否被有效应用于复杂现实任务,如识别重叠物体?

主要发现

  • 所提出的倒置点积注意力路由在CIFAR-10上达到95.14%的测试准确率,性能与ResNet-18相当,但参数量仅为后者的1/4。
  • 在CIFAR-100上,该模型达到78.02%的测试准确率,表明其在更复杂数据上的强大泛化能力。
  • 在包含重叠数字的DiverseMultiMNIST基准测试中,胶囊模型的收敛速度优于参数量和层数相同的CNN。
  • 与向量结构姿态相比,使用矩阵结构姿态和层归一化能显著提升训练稳定性和性能。
  • 并行路由机制相比顺序迭代路由,实现了更快的推理速度和更好的可扩展性。
  • 该模型优于先前的胶囊网络(包括DeepCaps在CIFAR-10上达到92.74%),表明胶囊网络在复杂视觉任务中可与SOTA CNN模型相媲美。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。