Skip to main content
QUICK REVIEW

[论文解读] Hard Mixtures of Experts for Large Scale Weakly Supervised Vision

Sam Gross, Marc’Aurelio Ranzato|arXiv (Cornell University)|Apr 20, 2017
Advanced Neural Network Applications参考文献 10被引用 7
一句话总结

本文提出一种用于大规模弱监督图像识别的硬性专家混合(MoE)架构,其中每张图像根据预训练卷积神经网络特征空间中的聚类结果被路由至单一专家。通过独立训练专家并共享解码器,该方法实现了在YFCC100M等数据集上大规模模型的高效扩展,在标签预测任务中取得显著准确率提升,并在细粒度分类任务中表现出更优的迁移性能。

ABSTRACT

Training convolutional networks (CNN's) that fit on a single GPU with minibatch stochastic gradient descent has become effective in practice. However, there is still no effective method for training large CNN's that do not fit in the memory of a few GPU cards, or for parallelizing CNN training. In this work we show that a simple hard mixture of experts model can be efficiently trained to good effect on large scale hashtag (multilabel) prediction tasks. Mixture of experts models are not new (Jacobs et. al. 1991, Collobert et. al. 2003), but in the past, researchers have had to devise sophisticated methods to deal with data fragmentation. We show empirically that modern weakly supervised data sets are large enough to support naive partitioning schemes where each data point is assigned to a single expert. Because the experts are independent, training them in parallel is easy, and evaluation is cheap for the size of the model. Furthermore, we show that we can use a single decoding layer for all the experts, allowing a unified feature embedding space. We demonstrate that it is feasible (and in fact relatively painless) to train far larger models than could be practically trained with standard CNN architectures, and that the extra capacity can be well used on current datasets.

研究动机与目标

  • 解决在超出GPU显存限制的大规模弱监督数据集上训练大型卷积神经网络的挑战。
  • 探究简单的、非端到端的MoE架构是否能在无需复杂路由优化的情况下有效扩展模型容量。
  • 评估MoE模型中共享解码器是否能保留可用于下游任务的可迁移特征。
  • 证明通过MoE进行架构扩展可缓解标准CNN在十亿规模数据集上的欠拟合问题。

提出的方法

  • 图像首先通过预训练的ResNet-18编码,从倒数第二层提取特征,并使用K-means对这些特征进行聚类以确定专家分配。
  • 每张图像被路由至最近的聚类中心,通过硬性路由机制分配给单一专家。
  • 专家在其分配的数据子集上独立训练,从而实现高效的并行训练。
  • 所有专家共享一个解码器,以统一特征空间,支持从最终特征层进行迁移学习。
  • 门控网络在聚类完成后固定,不进行端到端微调。
  • 模型评估采用q@10进行标签预测,以及在CUB和牛津花卉等下游数据集上的线性探测准确率。

实验结果

研究问题

  • RQ1简单的、非端到端的硬性专家混合模型是否能在大规模弱监督数据集上有效扩展模型容量?
  • RQ2通过基于聚类的门控机制将图像路由至单一专家,是否在大规模数据集上优于标准CNN?
  • RQ3专家之间共享解码器是否能保留对下游任务有意义的可迁移特征?
  • RQ4不同聚类中标签分布的稀疏性与模型预测准确率之间是否存在相关性?

主要发现

  • 与标准CNN相比,硬性MoE模型在YFCC100M上的标签预测准确率显著提升,表明其在大规模数据上有效缓解了欠拟合问题。
  • 在聚类中分布更稀疏的标签被更准确地预测,表明聚类结构与语义稀疏性相一致。
  • 共享解码器的MoE变体在CUB和牛津花卉等细粒度数据集上表现出更优的迁移性能,表明其学习到了高质量的特征。
  • 尽管门控网络未进行端到端训练,该方法仍实现了高效的并行训练与推理,且仅带来约2倍的计算成本,优于单一模型。
  • 在YFCC100M上预训练后,模型在ImageNet迁移任务上取得了具有竞争力的性能,表明弱监督数据在大规模下仍能生成强大特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。