Skip to main content
QUICK REVIEW

[论文解读] Confident Multiple Choice Learning

Kimin Lee, Chang Ho Hwang|arXiv (Cornell University)|Jun 12, 2017
Pharmacy and Medical Practices被引用 18
一句话总结

本文提出了一种名为置信多选学习(Confident Multiple Choice Learning, CMCL)的新颖集成方法,用于深度神经网络,通过减少模型预测的过度自信,同时保持高多样性与高准确率。通过引入置信圣杯损失(confident oracle loss)、特征共享和随机标签化,CMCL在CIFAR-10和SVHN上分别实现相对于独立集成(independent ensembles)14.05%和6.60%的相对误差降低,在iCoseg分割任务上最高实现6.77%的性能提升。

ABSTRACT

Ensemble methods are arguably the most trustworthy techniques for boosting the performance of machine learning models. Popular independent ensembles (IE) relying on naive averaging/voting scheme have been of typical choice for most applications involving deep neural networks, but they do not consider advanced collaboration among ensemble models. In this paper, we propose new ensemble methods specialized for deep neural networks, called confident multiple choice learning (CMCL): it is a variant of multiple choice learning (MCL) via addressing its overconfidence issue.In particular, the proposed major components of CMCL beyond the original MCL scheme are (i) new loss, i.e., confident oracle loss, (ii) new architecture, i.e., feature sharing and (iii) new training method, i.e., stochastic labeling. We demonstrate the effect of CMCL via experiments on the image classification on CIFAR and SVHN, and the foreground-background segmentation on the iCoseg. In particular, CMCL using 5 residual networks provides 14.05% and 6.60% relative reductions in the top-1 error rates from the corresponding IE scheme for the classification task on CIFAR and SVHN, respectively.

研究动机与目标

  • 为解决多选学习(Multiple Choice Learning, MCL)中过度自信的问题,该问题导致尽管圣杯误差较低,但top-1准确率表现不佳。
  • 开发一种新的深度神经网络集成训练方案,以生成多样化、置信且高质量的预测结果。
  • 在简单投票或平均的第二阶段中,通过改进传统独立集成(IE)和原始MCL,实现更优性能。
  • 设计一种训练方法,在保持低计算成本的同时显著提升预测准确率。

提出的方法

  • 提出一种名为置信圣杯损失的新损失函数,通过最小化标准MCL损失以及预测分布与均匀分布之间的Kullback-Leibler散度,以减少过度自信。
  • 通过在第一个池化层之前共享非线性激活特征,在集成模型之间实现特征共享,以正则化预测并提升泛化能力。
  • 在训练过程中应用随机标签化,通过在优化过程中随机分配标签,以增加集成成员之间的多样性。
  • 采用随机交替最小化方法,高效训练基于新损失函数的模型,同时保持与MCL或IE相似的训练复杂度。
  • 设计集成架构,使各模型专门学习数据的不同子集,模拟专家混合模型(mixture-of-experts)的机制,但无需显式门控机制。
  • 将该方法应用于多种架构,包括ResNet、VGGNet、GoogLeNet和全卷积网络(FCNs),并在图像分类与分割任务中均取得一致性能提升。

实验结果

研究问题

  • RQ1修改后的MCL框架是否能在保持高预测多样性的同时,减少深度神经网络集成的过度自信?
  • RQ2引入一种惩罚过度自信的置信圣杯损失,是否能提升集成模型的top-1准确率?
  • RQ3特征共享与随机标签化对图像分类与分割任务中集成模型的性能与泛化能力有何影响?
  • RQ4CMCL是否能在多个基准测试中超越传统独立集成(IE)和原始MCL,在top-1误差率方面表现更优?
  • RQ5CMCL在显著降低top-1误差率的同时,能在多大程度上保持低圣杯误差率,从而在真实视觉任务中实现性能提升?

主要发现

  • 在使用5个ResNet-20模型的CIFAR-10数据集上,CMCL相比独立集成(IE)实现了14.05%的top-1误差率相对降低。
  • 在SVHN数据集上,CMCL相比对应独立集成基线,将top-1误差降低了6.60%。
  • 在iCoseg的前景-背景分割任务中,CMCL相比使用5个FCN模型的IE,实现了高达6.77%的top-1误差率相对降低。
  • CMCL保持了与原始MCL相当的低圣杯误差率,表明尽管减少了过度自信,但预测的多样性仍得以保持。
  • 特征共享对CMCL的性能提升效果优于IE,且CMCL的性能增益随集成规模增大而增强,而IE则无此趋势。
  • 可视化分析表明,使用CMCL训练的各模型在不同图像类型上表现出专业化特征(例如,一个模型专注于‘龙虾’,另一个专注于‘鸭子’),而IE模型则缺乏此类专业化特征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。