[论文解读] A Branching and Merging Convolutional Network with Homogeneous Filter Capsules
该论文提出了一种具有分支与合并路径的新型卷积神经网络,将最终的卷积滤波器转换为同质向量胶囊,从而在不同感受野和抽象层次上实现更优的特征提取。该方法在 MNIST 上实现了新的 SOTA,使用集成模型达到 99.84% 的准确率,单模型达到 99.79%,同时相比之前的胶囊网络,模型参数和训练周期均减少了 75%。
We present a convolutional neural network design with additional branches after certain convolutions so that we can extract features with differing effective receptive fields and levels of abstraction. From each branch, we transform each of the final filters into a pair of homogeneous vector capsules. As the capsules are formed from entire filters, we refer to them as filter capsules. We then compare three methods for merging the branches--merging with equal weight and merging with learned weights, with two different weight initialization strategies. This design, in combination with a domain-specific set of randomly applied augmentation techniques, establishes a new state of the art for the MNIST dataset with an accuracy of 99.84% for an ensemble of these models, as well as establishing a new state of the art for a single model (99.79% accurate). These accuracies were achieved with a 75% reduction in both the number of parameters and the number of epochs of training relative to the previously best performing capsule network on MNIST. All training was performed using the Adam optimizer and experienced no overfitting.
研究动机与目标
- 通过在关键卷积层后引入分支路径,改进卷积网络中的特征表示。
- 通过从整个卷积滤波器中提取的滤波器胶囊,实现多尺度与多层级的抽象。
- 在保持或提升 MNIST 上性能的同时,降低模型复杂度与训练成本。
- 评估不同的合并策略——等权重与可学习权重——并采用不同的初始化方法以实现最佳性能。
提出的方法
- 该架构在特定卷积层后引入附加分支,以提取具有不同有效感受野的特征。
- 每个分支的最终卷积滤波器被转换为一对同质向量胶囊,称为滤波器胶囊。
- 评估了三种合并策略:简单平均(等权重)、随机初始化的可学习权重,以及 Xavier 初始化的可学习权重。
- 网络使用 Adam 优化器,并应用领域特定的数据增强技术以防止过拟合。
- 胶囊转换通过将整个滤波器输出编码为向量表示,保留了空间与层次信息。
- 模型采用端到端训练,即使在使用激进的数据增强时也未观察到过拟合现象。
实验结果
研究问题
- RQ1在卷积层后引入分支路径是否能提升 MNIST 上的特征抽象能力与模型准确率?
- RQ2在组合多个分支的特征时,等权重与可学习权重的合并策略对性能有何影响?
- RQ3在使用这种基于胶囊的架构时,参数量与训练周期最多可减少多少而不牺牲准确率?
- RQ4与标准特征图相比,使用从完整卷积滤波器中提取的滤波器胶囊是否能增强表征学习?
- RQ5结合领域特定的数据增强与该架构,是否能进一步提升性能并保持泛化能力?
主要发现
- 所提出的模型在 MNIST 数据集上实现了新的 SOTA,集成模型准确率达到 99.84%。
- 单个模型达到 99.79% 的准确率,创下 MNIST 上单模型的 SOTA 新纪录。
- 与之前在 MNIST 上表现最佳的胶囊网络相比,该方法将参数数量和训练周期均减少了 75%。
- 尽管经过大量数据增强且模型容量较高,该模型仍无过拟合迹象。
- 采用 Xavier 初始化的可学习权重合并策略优于其他策略,表明在胶囊融合中正确初始化权重至关重要。
- 使用滤波器胶囊可在保持计算效率的同时,实现有效的层次化特征表示。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。