Skip to main content
QUICK REVIEW

[论文解读] Unbiased scalable softmax optimization

Francois Fagan, Garud Iyengar|arXiv (Cornell University)|Mar 22, 2018
Parallel Computing and Optimization Techniques参考文献 17被引用 8
一句话总结

本文提出两种无偏、可扩展的随机梯度下降算法——隐式SGD(Implicit SGD)和U-max——用于优化包含数百万类的大规模Softmax模型。通过将似然函数重述为双重求和形式,并采用具有有界方差的高效梯度更新,该方法实现了每轮迭代O(D)的时间复杂度,在七个真实世界数据集上,其对数损失降低幅度相比有偏基线方法最高达4.44倍。

ABSTRACT

Recent neural network and language models rely on softmax distributions with an extremely large number of categories. Since calculating the softmax normalizing constant in this context is prohibitively expensive, there is a growing literature of efficiently computable but biased estimates of the softmax. In this paper we propose the first unbiased algorithms for maximizing the softmax likelihood whose work per iteration is independent of the number of classes and datapoints (and no extra work is required at the end of each epoch). We show that our proposed unbiased methods comprehensively outperform the state-of-the-art on seven real world datasets.

研究动机与目标

  • 解决在包含数百万类的大规模模型中计算Softmax归一化常数的计算不可行性问题。
  • 克服现有近似方法存在的偏差与不稳定性,这些缺陷会损害对最优解的收敛性。
  • 开发可扩展的无偏优化算法,其每轮迭代成本与类别数和数据点数无关。
  • 确保训练过程稳定且可收敛,而无需在每个周期内进行昂贵的全批量归一化计算。

提出的方法

  • 将带Tikhonov正则化的Softmax对数似然重述为数据点与类别之间的双重求和,以支持对两者进行小批量采样。
  • 提出隐式SGD,采用二分法实现高效且稳定的步长计算,并获得线性有界的步长。
  • 引入U-max,一种新型SGD变体,可保证在学习率足够小时梯度有界且收敛。
  • 通过使用紧密的初始边界和凸优化技术,确保梯度更新过程中的数值稳定性。
  • 利用双重求和结构,将每轮迭代成本降低至O(D),与K和N无关。
  • 在对学习率和参数边界施加弱假设的前提下,证明两种算法均具有收敛性和稳定性保证。

实验结果

研究问题

  • RQ1我们能否设计一种无偏优化方法,用于大规模Softmax模型,从而避免计算完整归一化和的高昂开销?
  • RQ2在类别数K较大的情况下,当梯度具有高方差和动态范围时,如何稳定随机梯度更新?
  • RQ3我们能否在保持O(D)每轮迭代复杂度的同时,实现对真实最大似然估计的收敛?
  • RQ4所提出的双重求和形式是否能实现稳定高效的训练,而无需周期性地进行全批量归一化?
  • RQ5在实际应用中,与更快但精度较低的有偏基线方法相比,所提出的无偏方法表现如何?

主要发现

  • 在七个真实世界数据集上,隐式SGD的平均对数损失比之前最先进的有偏方法降低了4.44倍。
  • U-max与隐式SGD在对数损失和收敛速度方面均优于所有基线方法,包括OVE、NCE、IS和普通SGD。
  • 所提方法保持了O(D)的每轮迭代成本,与类别数K和数据点数N无关,从而实现了大规模问题的可扩展性。
  • 隐式SGD的每轮迭代速度优于OVE/NCE/IS/Vanilla/U-max,各数据集上的平均运行时间比为1.60。
  • U-max在学习率足够小时表现出稳定的训练过程,梯度有界且保证收敛,而普通SGD则不具备此特性。
  • 双重求和结构使得每轮迭代中可高效采样数据点与类别,降低了计算开销,同时保持了无偏性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。