Skip to main content
QUICK REVIEW

[论文解读] Deep Combinatorial Aggregation

Yuesong Shen, Daniel Cremers|arXiv (Cornell University)|Oct 12, 2022
Anomaly Detection Techniques and Applications被引用 4
一句话总结

本文提出了深度组合聚合(DCA),一种深度集成的组合泛化方法,通过分层网络组件组合聚合多样化模型预测,提升不确定性感知学习。DCA在预测准确率和不确定性估计方面均达到最先进性能;细粒度DCA实现了新型权重平均方法(DCWA),无需定制训练调度或批归一化调整即可匹配SWA性能。

ABSTRACT

Neural networks are known to produce poor uncertainty estimations, and a variety of approaches have been proposed to remedy this issue. This includes deep ensemble, a simple and effective method that achieves state-of-the-art results for uncertainty-aware learning tasks. In this work, we explore a combinatorial generalization of deep ensemble called deep combinatorial aggregation (DCA). DCA creates multiple instances of network components and aggregates their combinations to produce diversified model proposals and predictions. DCA components can be defined at different levels of granularity. And we discovered that coarse-grain DCAs can outperform deep ensemble for uncertainty-aware learning both in terms of predictive performance and uncertainty estimation. For fine-grain DCAs, we discover that an average parameterization approach named deep combinatorial weight averaging (DCWA) can improve the baseline training. It is on par with stochastic weight averaging (SWA) but does not require any custom training schedule or adaptation of BatchNorm layers. Furthermore, we propose a consistency enforcing loss that helps the training of DCWA and modelwise DCA. We experiment on in-domain, distributional shift, and out-of-distribution image classification tasks, and empirically confirm the effectiveness of DCWA and DCA approaches.

研究动机与目标

  • 解决神经网络在安全关键和主动学习应用中不确定性估计性能差的问题。
  • 通过探索多层次粒度的网络组件组合,将深度集成方法进行组合泛化。
  • 开发一种新型权重平均技术(DCWA),在无需定制训练调度或批归一化调整的前提下提升泛化性能。
  • 引入一致性强制损失,提升DCA模型的预测一致性与不确定性校准性能。
  • 在分布内、分布偏移和分布外图像分类基准上,对DCA进行实证验证。

提出的方法

  • DCA通过组合不同网络组件实例(如层、模块或完整模型)的组合方式,构建多个模型预测。
  • 对于细粒度DCA,该方法提出深度组合权重平均(DCWA),在不需迭代训练或学习率调度的前提下,计算组件实例间模型权重的平均值。
  • 在DCA训练过程中应用一致性强制损失,以增强模型预测之间的一致性,从而同时提升准确率与不确定性校准性能。
  • DCA采用改进的反向传播方案,对每个小批量中随机采样的多个组件预测进行梯度累积,以实现联合优化。
  • 该方法支持多种粒度:层级、主干级与模型级DCA,每种粒度在多样性与性能之间提供不同的权衡。
  • DCWA使用标准交叉熵或负对数似然损失进行端到端训练,可作为单一模型部署,无需集成推理。

实验结果

研究问题

  • RQ1深度集成的组合泛化方法是否能超越标准深度集成,在不确定性估计方面表现更优?
  • RQ2细粒度DCA结合DCWA是否能在无需定制训练调度的情况下,实现与随机权重平均(SWA)相当的性能?
  • RQ3一致性强制损失如何影响DCA模型的预测与不确定性校准性能?
  • RQ4粗粒度DCA变体(如模型级DCA)是否能在分布内、分布偏移与分布外场景下超越深度集成?
  • RQ5DCA组件实例数量的增加对模型性能与计算成本有何影响?

主要发现

  • 模型级DCA在CIFAR-10上达到最高准确率(94.95% ± 0.0008)与最低负对数似然(NLL,0.1601 ± 0.0006),优于所有基线方法,包括深度集成与SWA。
  • DCWA结合负对数似然损失,实现93.14% ± 0.0017准确率与0.0365 ± 0.0014 ECE,展现出优异的不确定性校准性能。
  • 一致性强制损失提升了模型级DCA的不确定性估计性能,当使用该损失训练时,ECE从0.0107 ± 0.0004降低至0.0084 ± 0.0009。
  • 主干级DCA在保持竞争力性能的同时,生成比深度集成更丰富的预测多样性,准确率为94.54% ± 0.0008,ECE为0.0080 ± 0.0011。
  • 将DCA组件实例数量从2增加至5,持续提升了准确率与NLL表现,表明计算成本与性能之间具有有利的权衡。
  • DCWA性能与SWA相当,但无需学习率调度或批归一化适应,显著提升了实现与部署的便捷性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。