Skip to main content
QUICK REVIEW

[论文解读] Efficient Training on Very Large Corpora via Gramian Estimation

Walid Krichene, Nicolas Mayoraz|arXiv (Cornell University)|Jul 18, 2018
Topic Modeling参考文献 27被引用 7
一句话总结

该论文提出了 SOGram 和 SAGram,通过利用随机梯度更新对 Gramian 矩阵进行估计,从而在非常大规模语料上高效训练非线性嵌入模型,避免了对未观测到的样本对进行昂贵采样。该方法相比标准采样方法显著加快了训练速度并提升了泛化性能——在验证集上的 MAP 最高提升了 33.2%,尤其在大规模数据集上表现更优。

ABSTRACT

We study the problem of learning similarity functions over very large corpora using neural network embedding models. These models are typically trained using SGD with sampling of random observed and unobserved pairs, with a number of samples that grows quadratically with the corpus size, making it expensive to scale to very large corpora. We propose new efficient methods to train these models without having to sample unobserved pairs. Inspired by matrix factorization, our approach relies on adding a global quadratic penalty to all pairs of examples and expressing this term as the matrix-inner-product of two generalized Gramians. We show that the gradient of this term can be efficiently computed by maintaining estimates of the Gramians, and develop variance reduction schemes to improve the quality of the estimates. We conduct large-scale experiments that show a significant improvement in training time and generalization quality compared to traditional sampling methods.

研究动机与目标

  • 解决由于在排斥损失项中未观测样本对数量随规模呈二次增长,导致在非常大规模语料上训练非线性嵌入模型计算不可行的问题。
  • 克服传统采样方法的局限性,即随着语料规模增大,其质量下降,且需使用大样本量以维持准确性。
  • 在非线性模型中利用受矩阵分解启发的 Gramian 表达形式,其中左、右嵌入均为非线性,通过维护 Gramian 矩阵的随机估计来实现。
  • 提出用于 Gramian 估计的方差减少技术,以在不增加样本量的前提下提高梯度估计的准确性。
  • 证明更优的全局损失项估计可带来更好的泛化性能和在大规模设置下的更快收敛速度。

提出的方法

  • 将全局排斥损失表述为两个广义 Gramian 矩阵的矩阵内积,通过矩阵运算实现高效的梯度计算。
  • 使用小批量更新维护左、右 Gramian 矩阵的随机估计,并采用独立的学习率 α 以降低方差。
  • 提出 SOGram(Stochastic Optimal Gramian)和 SAGram(Stochastic Averaged Gramian)作为 Gramian 的方差减少估计器,其中 SAGram 使用过去估计值的运行平均。
  • 利用估计的 Gramian 矩阵推导出损失项的闭式梯度,从而实现端到端反向传播,无需显式采样未观测到的样本对。
  • 将估计的梯度集成到标准 SGD 训练中,用估计的损失项替代采样的未观测样本对。
  • 对 Gramian 更新使用衰减学习率,以平衡偏差与方差,提升收敛性和最终模型性能。

实验结果

研究问题

  • RQ1是否可以在不采样大量未观测样本对的情况下,高效估计非线性嵌入模型中的全局排斥损失项?
  • RQ2Gramian 估计的质量如何影响大规模嵌入学习中的训练速度与泛化性能?
  • RQ3如 SAGram 这类方差减少技术能否提升非线性模型中梯度估计的稳定性和准确性?
  • RQ4Gramian 估计中的偏差-方差权衡是什么?它如何影响模型收敛与最终性能?
  • RQ5在非常大规模语料上,所提方法在训练时间与泛化性能方面是否优于基于采样的方法?

主要发现

  • 在英语数据集上,SOGram 在 2 小时训练预算下达到的最终验证 MAP 比基线采样方法高出 33.2%,甚至超过采样方法在 50 小时训练后的表现。
  • 在法语数据集上,SOGram 相比采样方法将验证 MAP 提升了 30.7%,在大规模语料上展现出显著优势。
  • 当批量大小为 128 时,SOGram 的 Gramian 估计质量可与批量大小为 1024 的采样方法相媲美,显著降低了计算成本。
  • 偏差-方差权衡得到实证验证:较低的学习率(α = 0.001)虽收敛较慢,但最终性能更优;而较高的 α 值虽降低偏差,但增加了方差。
  • SOGram 在不降低训练集性能的前提下持续提升泛化性能,表明对全局损失项的更好估计起到了正则化作用。
  • 消融实验表明,SAGram 在 Gramian 估计中提供了最精确的估计,其估计误差低于采样方法和 SOGram,尽管内存开销更高。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。