Skip to main content
QUICK REVIEW

[论文解读] Pushing the bounds of dropout

Gábor Melis, Charles Blundell|arXiv (Cornell University)|May 23, 2018
Topic Modeling参考文献 23被引用 12
一句话总结

本文将dropout训练重新解释为在共享相同下界目标的条件模型族上的MAP估计。它表明,通常被视为近似方法的确定性dropout,实际上是对真实目标最紧致且最精确的近似,结合最优softmax温度调优后,在语言建模任务中取得了最先进性能。

ABSTRACT

We show that dropout training is best understood as performing MAP estimation concurrently for a family of conditional models whose objectives are themselves lower bounded by the original dropout objective. This discovery allows us to pick any model from this family after training, which leads to a substantial improvement on regularisation-heavy language modelling. The family includes models that compute a power mean over the sampled dropout masks, and their less stochastic subvariants with tighter and higher lower bounds than the fully stochastic dropout objective. We argue that since the deterministic subvariant's bound is equal to its objective, and the highest amongst these models, the predominant view of it as a good approximation to MC averaging is misleading. Rather, deterministic dropout is the best available approximation to the true objective.

研究动机与目标

  • 为dropout提供理论基础,以解决其解释和评估中的模糊性。
  • 在由dropout训练导出的模型族中识别出性能最佳的模型。
  • 通过在训练后选择最优推理方法,提升语言建模的泛化能力。
  • 用可调的、基于原理的softmax温度方法替代启发式评估方法。

提出的方法

  • 将dropout重新表述为对一组条件模型的MAP估计,每个模型对应一种不同的dropout掩码预测聚合方式。
  • 推导出标准dropout目标是该模型族中所有模型的共同下界,且确定性变体具有最紧致的下界。
  • 提出使用幂平均(如算术平均、几何平均和确定性平均)评估模型,并在推理时选择表现最佳的模型。
  • 在测试时引入温度调整的softmax,以近似最优模型的偏差,从而实现高效的超参数调优。
  • 在小规模验证子集上使用线性搜索寻找最优softmax温度,避免昂贵的MC dropout评估。
  • 将该方法应用于基于RNN的语言模型,通过重新调优评估参数以提升困惑度。

实验结果

研究问题

  • RQ1dropout训练过程中实际优化的目标是什么,它与不同推理方法有何关联?
  • RQ2为何确定性dropout常被视为良好近似,它是否实际上是该族中的最优模型?
  • RQ3我们能否在训练后从该族中选择最佳模型,以提升语言建模的泛化能力?
  • RQ4在推理时调整softmax温度是否能提升性能,且能否作为昂贵的MC dropout的代理?

主要发现

  • 确定性dropout变体具有最紧致的下界,因此是对真实目标的最佳近似,这与普遍认为其仅为MC dropout近似的观点相反。
  • 在Penn Treebank数据集上,通过使用最优温度重新调优评估参数,该方法将测试困惑度从58.3降低至55.3。
  • 在Wikitext-2数据集上,仅通过在验证集上调优评估参数,该方法将困惑度从65.9降低至63.7。
  • 确定性模型的最优softmax温度略低于1,表明其具有锐化而非平滑作用,且通过在小规模验证集上进行线性搜索高效获得。
  • 使用最优温度调优使性能提升了约半个困惑度点,表明结合温度调整的确定性推理是最佳可能评估方法的强有力代理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。